学习指南模型选型企业落地方法论
企业 AI 模型选型:先定场景,再比价格
不从模型榜单出发,而从业务场景的延迟、上下文、合规与失败代价出发,给出可执行的选型流程、评测集设计与常见误判,避免「买了最贵的却用在最便宜的活上」。
学习指南约 10 分钟发布 2026-09-23
为什么「先看榜单」会选错
榜单回答的是「谁综合能力更强」,企业要回答的是「谁在我的任务上又稳又便宜」。 两者经常不是同一个答案:分类、抽取、路由这类活,轻量档足够,上旗舰是浪费; 而合同要点漏抽、代码改错接口,用便宜模型省下的钱不够赔一次事故。
选型顺序应该是:场景约束 → 候选短名单 → 同套评测 → 真实用量算钱 → 影子运行。 反过来「先买最贵的再找场景」是成本失控最常见的起点。
价格对比数据见 《主流大模型 API 计费标准对比》。本文不重复标价,只解决「怎么选」。
一、先把场景拆成四个维度
四条里至少有两条会互相打架(便宜 vs 稳、快 vs 深)。打分的意义是把「哪条可妥协」写下来,而不是加权求和装客观。
| 维度 | 要问的问题 | 如何影响选型 | 例子 |
|---|---|---|---|
| 延迟与交互 | 有人盯着屏幕等结果,还是夜间跑完即可? | 有人等 → 不能走 Batch;流式几乎是硬需求 | 对话客服、编码助手 vs 报表生成、语料清洗 |
| 上下文与吞吐 | 单次要塞进多长材料?一天大概多少次调用? | 长文档/整仓代码看上下文窗口与跳档规则;高频轻任务看限流与单价 | 合同审查、代码库问答 vs 分类打标、摘要 |
| 失败代价 | 答错一次是重问一句,还是过账、出报告、改代码? | 代价高 → 用旗舰 + 人工复核;代价低 → 可上 flash 档扩量 | 财务摘要、医疗/法律草稿 vs 营销灵感、内部搜索 |
| 合规与数据边界 | 数据能否出境?是否要求私有化 / 审计日志 / 不训练承诺? | 有边界 → 国内合规节点或私有化开源权重;跨境业务单独评估 | 含客户隐私的工单、源代码、未公开财报 |
二、一条可执行的选型路径
| 步骤 | 做什么 | 产出 |
|---|---|---|
| 1. 写清任务句式 | 用一句话写清「谁、在什么输入下、要什么输出、给谁用」。写不出来就先别买模型。 | 输出一页任务说明书 |
| 2. 标出四个维度 | 按上表给延迟 / 上下文 / 失败代价 / 合规打硬约束与软偏好。 | 约束清单(不可妥协项只留 1~3 条) |
| 3. 缩小候选到 3 个 | 按约束过滤到「旗舰 / 均衡 / 轻量」各一,或两档同代对比。禁止同时测 8 个。 | 候选模型短名单 |
| 4. 跑同一套评测集 | 20~50 条真实业务样本,盲评或规则判分;记录延迟、失败率、格式稳定度。 | 评分表 + 失败样例库 |
| 5. 算落地月成本 | 用你们真实调用量结构(输入/输出 token 比、缓存命中率、是否可 Batch)套价格表,不要用演示 demo 的量。 | 月成本区间 + 优化开关 |
| 6. 做一周影子运行 | 新模型与旧链路并行输出,人眼抽样对比;满意再切主链路。 | 切换/回滚结论 |
短名单为什么是 3 个而不是 8 个:评测成本随候选数线性涨,而决策质量在超过 3 个后提升很有限。多出来的精力应花在把失败样例收齐,而不是再开一个 API Key。
三、评测集怎么设计才有用
3.1 条数与构成
- 20–50 条起步,宁少而真,不要 500 条生成假数据。 少样本时先看「会不会系统性翻车」,而不是算平均分。
- 按真实分布抽:简单 / 中等 / 边角 ≈ 5 : 3 : 2。 边角(超长、乱格式、多语言、空字段)决定线上事故率。
- 固定输出契约:让模型输出 JSON 或固定标题结构,方便规则判分; 格式失败单独计数,不要和「内容不对」混在一个总分里。
3.2 至少记这四个指标
- 业务正确率:人工盲评或规则/小模型裁判,记录「关键字段漏/错」而不是笼统打星。
- 格式稳定率:能否稳定吐出可解析结构。差 5% 意味着上游要写重试与容错。
- P50 / P95 延迟:交互链路看 P95;批处理看总耗时即可。
- 单次有效成本:算进重试与失败重跑,而不是目录单价。
中文业务的有效评测,样本量再小也要覆盖你们自己的术语表与句长习惯; 拿公开英文榜单分数直接外推到中文合同/工单,偏差会很大。
四、比价时真正该比的四条
| 规则 | 为什么 | 怎么做 |
|---|---|---|
| 按「输出」而不是「输入」做主杠杆 | 输出/输入价普遍 3~5 倍;长输出模型会吞掉预算 | 限制 max_tokens;能出结构化 JSON 就不要长文;关掉不必要的思考链 |
| 把缓存命中率当成产品指标 | 固定系统提示词 / 知识库前缀场景,缓存可砍掉大半输入成本 | 拆分「稳定前缀 + 动态尾部」;监控 cached_tokens 占比 |
| 非实时一律问一句「能不能 Batch」 | 多家统一 5 折,是无门槛折扣 | 评测、打标、夜间汇总、语料回填走 Batch |
| 警惕长上下文「整包跳档」 | 超出阈值后整个请求按更高单价计,不是只对超出部分加价 | 先切片检索再拼提示词;把跳档阈值写进成本模型 |
具体单价、缓存倍率、Batch 叠加规则以 计费对比报告 核实版为准;价格随促销与调价变动,落地前请再对一次官方定价页。
五、常见误判清单
这些判断在企业里反复出现,也反复吃亏
- 「最贵 = 最合适」——把旗舰用在分类抽取上,月账单可以差一个数量级。
- 「demo 好用 = 生产可用」——演示是理想输入;生产里有脏数据、超长、半句话、截图糊。
- 「换个模型只要改个 model 名」——提示词、输出 schema、工具调用协议、限流与重试策略都要回归。
- 「先上免费额度再决定」——免费档并发与 SLA 往往不能代表付费生产档;适合探活,不适合定生死。
- 「只测正确率就够」——格式崩、超时、内容拒答,线上都表现为「不可用」,评测必须单列。
- 「所有任务共用一个模型」——应按失败代价分级路由:重活旗舰、常活均衡、轻活 flash。
六、落地检查清单
- 任务说明书一页,写清输入 / 输出 / 使用者 / 失败代价。
- 四维约束里「不可妥协项」不超过 3 条。
- 候选短名单 ≤ 3,且覆盖至少两个价格档。
- 评测集 20~50 条真样本,含边角;指标含格式稳定率。
- 成本按真实调用量结构试算,并列出缓存 / Batch / 路由三个开关的收益。
- 影子运行 ≥ 1 周,抽样对比旧结果;准备回滚开关。
- 价格表外置,带生效区间;上线后每周对一次官方定价页。
需要按你们的业务样本做一版选型评测,或把成本模型做成可配置表,可从 免费咨询 入口约一次需求沟通。