返回知识库
学习指南模型选型企业落地方法论

企业 AI 模型选型:先定场景,再比价格

不从模型榜单出发,而从业务场景的延迟、上下文、合规与失败代价出发,给出可执行的选型流程、评测集设计与常见误判,避免「买了最贵的却用在最便宜的活上」。

学习指南约 10 分钟发布 2026-09-23

为什么「先看榜单」会选错

榜单回答的是「谁综合能力更强」,企业要回答的是「谁在我的任务上又稳又便宜」。 两者经常不是同一个答案:分类、抽取、路由这类活,轻量档足够,上旗舰是浪费; 而合同要点漏抽、代码改错接口,用便宜模型省下的钱不够赔一次事故。

选型顺序应该是:场景约束 → 候选短名单 → 同套评测 → 真实用量算钱 → 影子运行。 反过来「先买最贵的再找场景」是成本失控最常见的起点。

价格对比数据见 《主流大模型 API 计费标准对比》。本文不重复标价,只解决「怎么选」。

一、先把场景拆成四个维度

四条里至少有两条会互相打架(便宜 vs 稳、快 vs 深)。打分的意义是把「哪条可妥协」写下来,而不是加权求和装客观。

维度要问的问题如何影响选型例子
延迟与交互有人盯着屏幕等结果,还是夜间跑完即可?有人等 → 不能走 Batch;流式几乎是硬需求对话客服、编码助手 vs 报表生成、语料清洗
上下文与吞吐单次要塞进多长材料?一天大概多少次调用?长文档/整仓代码看上下文窗口与跳档规则;高频轻任务看限流与单价合同审查、代码库问答 vs 分类打标、摘要
失败代价答错一次是重问一句,还是过账、出报告、改代码?代价高 → 用旗舰 + 人工复核;代价低 → 可上 flash 档扩量财务摘要、医疗/法律草稿 vs 营销灵感、内部搜索
合规与数据边界数据能否出境?是否要求私有化 / 审计日志 / 不训练承诺?有边界 → 国内合规节点或私有化开源权重;跨境业务单独评估含客户隐私的工单、源代码、未公开财报

二、一条可执行的选型路径

步骤做什么产出
1. 写清任务句式用一句话写清「谁、在什么输入下、要什么输出、给谁用」。写不出来就先别买模型。输出一页任务说明书
2. 标出四个维度按上表给延迟 / 上下文 / 失败代价 / 合规打硬约束与软偏好。约束清单(不可妥协项只留 1~3 条)
3. 缩小候选到 3 个按约束过滤到「旗舰 / 均衡 / 轻量」各一,或两档同代对比。禁止同时测 8 个。候选模型短名单
4. 跑同一套评测集20~50 条真实业务样本,盲评或规则判分;记录延迟、失败率、格式稳定度。评分表 + 失败样例库
5. 算落地月成本用你们真实调用量结构(输入/输出 token 比、缓存命中率、是否可 Batch)套价格表,不要用演示 demo 的量。月成本区间 + 优化开关
6. 做一周影子运行新模型与旧链路并行输出,人眼抽样对比;满意再切主链路。切换/回滚结论
短名单为什么是 3 个而不是 8 个:评测成本随候选数线性涨,而决策质量在超过 3 个后提升很有限。多出来的精力应花在把失败样例收齐,而不是再开一个 API Key。

三、评测集怎么设计才有用

3.1 条数与构成

  • 20–50 条起步,宁少而真,不要 500 条生成假数据。 少样本时先看「会不会系统性翻车」,而不是算平均分。
  • 按真实分布抽:简单 / 中等 / 边角 ≈ 5 : 3 : 2。 边角(超长、乱格式、多语言、空字段)决定线上事故率。
  • 固定输出契约:让模型输出 JSON 或固定标题结构,方便规则判分; 格式失败单独计数,不要和「内容不对」混在一个总分里。

3.2 至少记这四个指标

  • 业务正确率:人工盲评或规则/小模型裁判,记录「关键字段漏/错」而不是笼统打星。
  • 格式稳定率:能否稳定吐出可解析结构。差 5% 意味着上游要写重试与容错。
  • P50 / P95 延迟:交互链路看 P95;批处理看总耗时即可。
  • 单次有效成本:算进重试与失败重跑,而不是目录单价。

中文业务的有效评测,样本量再小也要覆盖你们自己的术语表与句长习惯; 拿公开英文榜单分数直接外推到中文合同/工单,偏差会很大。

四、比价时真正该比的四条

规则为什么怎么做
按「输出」而不是「输入」做主杠杆输出/输入价普遍 3~5 倍;长输出模型会吞掉预算限制 max_tokens;能出结构化 JSON 就不要长文;关掉不必要的思考链
把缓存命中率当成产品指标固定系统提示词 / 知识库前缀场景,缓存可砍掉大半输入成本拆分「稳定前缀 + 动态尾部」;监控 cached_tokens 占比
非实时一律问一句「能不能 Batch」多家统一 5 折,是无门槛折扣评测、打标、夜间汇总、语料回填走 Batch
警惕长上下文「整包跳档」超出阈值后整个请求按更高单价计,不是只对超出部分加价先切片检索再拼提示词;把跳档阈值写进成本模型

具体单价、缓存倍率、Batch 叠加规则以 计费对比报告 核实版为准;价格随促销与调价变动,落地前请再对一次官方定价页。

五、常见误判清单

这些判断在企业里反复出现,也反复吃亏
  1. 「最贵 = 最合适」——把旗舰用在分类抽取上,月账单可以差一个数量级。
  2. 「demo 好用 = 生产可用」——演示是理想输入;生产里有脏数据、超长、半句话、截图糊。
  3. 「换个模型只要改个 model 名」——提示词、输出 schema、工具调用协议、限流与重试策略都要回归。
  4. 「先上免费额度再决定」——免费档并发与 SLA 往往不能代表付费生产档;适合探活,不适合定生死。
  5. 「只测正确率就够」——格式崩、超时、内容拒答,线上都表现为「不可用」,评测必须单列。
  6. 「所有任务共用一个模型」——应按失败代价分级路由:重活旗舰、常活均衡、轻活 flash。

六、落地检查清单

  • 任务说明书一页,写清输入 / 输出 / 使用者 / 失败代价。
  • 四维约束里「不可妥协项」不超过 3 条。
  • 候选短名单 ≤ 3,且覆盖至少两个价格档。
  • 评测集 20~50 条真样本,含边角;指标含格式稳定率。
  • 成本按真实调用量结构试算,并列出缓存 / Batch / 路由三个开关的收益。
  • 影子运行 ≥ 1 周,抽样对比旧结果;准备回滚开关。
  • 价格表外置,带生效区间;上线后每周对一次官方定价页。

需要按你们的业务样本做一版选型评测,或把成本模型做成可配置表,可从 免费咨询 入口约一次需求沟通。