返回知识库
调研报告API 计费成本优化模型选型

主流大模型 API 计费标准对比(2026-09)

统一口径横比 OpenAI / Anthropic / Google / DeepSeek / 通义 / 豆包 / 智谱 / Kimi / MiniMax / MiMo 的输入、缓存、输出与批量折扣,附典型用量月成本排序与成本计算模块的数据结构建议。

调研报告约 25 分钟核实 2026-09-23

结论先行

结论先行
  1. 同代旗舰「输入价」差 10 倍以上:GPT-6 Astra $10/M 输入 vs DeepSeek-V4-Flash $0.30/M,中间档(GPT-5.6 Terra $2、Gemini 3.1 Pro $2、Claude Sonnet 5 $3、Qwen3.7-Plus ¥2≈$0.30)才是多数业务的实际落点。
  2. 输出价才是成本主角:输出/输入价格比普遍在 3~5 倍(Kimi K3 达 5 倍、Qwen3.8-Max 3 倍、Gemini 3.5 Flash 6 倍)。压成本先压输出(限长、限思考链)而不是压输入。
  3. 缓存命中价是最猛的杠杆:海外普遍为输入价的 10%,DeepSeek 缓存命中低至 $0.006/M(约原价 2%),国内约 10%~25%。系统提示词固定的场景,缓存能把成本砍掉 60%~90%。
  4. 批量(Batch)折扣高度一致:全部 5 折(OpenAI / Anthropic / Gemini / 百炼 / 火山 / 智谱)。非实时任务一律走 Batch,是最省事的 50%。
  5. 长上下文要防「整包跳档」:Gemini 3.1 Pro 超 200K 后 $2→$4 输入、$12→$18 输出;豆包按输入长度三档逐级翻倍;Anthropic 自 2026-03-13 起取消 >200K 加价、1M 内一口价。这些是账单超预期的主要来源。
  6. 工程上必须把价格表外置:本报告周期内就有多起调价。价格表要做成带 effective_from / effective_to 的可配置数据,禁止硬编码。

一、主力文本模型价格对比(统一口径:每 100 万 token)

国内厂商按官方人民币价列出,并在最后一列给出按 6.70 折算的美元参考价;海外厂商同时给出人民币参考价。「—」表示官方未公布或不适用。

厂商主力模型定位 / 适用场景输入价缓存命中价输出价上下文美元参考
OpenAI
海外
GPT-6 Astra顶级旗舰,超难推理/研究级任务$10.00$1.00$50.00—$10.00
GPT-5.6 Sol主力旗舰,复杂 Agent、长链推理$4.00$0.40$20.00400K$4.00
GPT-5.6 Terra均衡档,日常生产主力$2.00$0.20$12.00—$2.00
GPT-5.6 Luna轻量高频,分类/抽取/路由$0.20$0.02$1.201.05M$0.20
Anthropic
海外
Claude Fable 5.1长时程 Agent、超高难度任务$10.00$0.25$50.001M$10.00
Claude Opus 5.5复杂 Agentic Coding、企业重度任务$4.00$0.20$20.001M$4.00
Claude Sonnet 5编码/分析/Agent 主力 2026-09-01 起转标准价$2.00→$3.00$0.20→$0.30$10.00→$15.001M$3.00
Claude Haiku 4.5高速低价,分类/路由/客服$1.00$0.10$5.00200K$1.00
Google
海外
Gemini 3.1 Pro旗舰推理、长文档、Agent(≤200K 档)$2.00$0.20$12.001M$2.00
Gemini 3.5 Flash速度+智能均衡,grounding 场景$1.50$0.15$9.001M$1.50
Gemini 3.8 / 3.7 Flash生产级 Agent、文档批处理 促销价至 2026-12-31$0.75$0.075$3.751M$0.75
Gemini 3.5 Flash-Lite翻译/抽取/高并发轻量任务$0.30$0.03$2.501M$0.30
Gemini 2.5 Flash-Lite成本地板,摘要/分类$0.10$0.01$0.401M$0.10
DeepSeek
国内
deepseek-v4-pro旗舰混合推理,复杂推理/编程$1.32 ≈¥8.84$0.044$3.96 ≈¥26.51M$1.32
deepseek-flash(V4.1-Flash)高并发生成、日常对话/批量$0.30 ≈¥2.01$0.006$1.20 ≈¥8.041M$0.30
阿里通义(百炼)
国内
qwen3.8-max最强推理,对标 GPT-5.5 / Opus 级¥12.0¥1.5¥36.01M$1.79
qwen3.7-max旗舰降本档,实际 ¥6/¥18 限时5折¥6.0¥0.6¥18.01M$0.90
qwen3.7-plus综合主力,办公/Agent/文档(≤256K) 限时8折¥2.0¥0.4¥8.01M$0.30
qwen3.8-flash接近旗舰效果的低成本主力¥0.8¥0.1¥2.71M$0.12
qwen3.7-flash超低成本,分类/抽取/高并发¥0.2¥0.04¥0.81M$0.03
字节豆包(火山方舟)
国内
Doubao-Seed-Evolving / 2.1-proCoding & Agent 旗舰,生产级任务¥6.0≈¥1.2¥30.0256K~1M$0.90
Doubao-Seed-2.1-turbo效果/成本均衡¥3.0≈¥0.6¥15.0256K$0.45
Doubao-Seed-2.0-pro(≤32K)复杂推理;32-128K 档 ¥4.8/¥24¥3.2¥0.64¥16.0256K$0.48
Doubao-Seed-2.0-lite(≤32K)高吞吐日常负载,全模态理解¥0.6¥0.12¥3.6256K$0.09
Doubao-Seed-2.0-mini(≤32K)低时延低成本,大批量简单任务¥0.2¥0.04¥2.0256K$0.03
智谱
国内
GLM-5.3最新旗舰,编程/复杂推理¥8.0¥2.0¥28.01M$1.19
GLM-5.3-Flash多模态普惠档,折后 ¥0.4/¥1.4 限时5折¥0.8¥0.23¥2.81M$0.12
GLM-4.7-Flash免费档,原型验证/低优先任务¥0¥0¥0200K$0
月之暗面
国内
Kimi K3旗舰,软件工程/深度推理¥20.0¥2.0¥100.01M$2.99
Kimi K2.7 Code编程专用,长上下文指令遵循¥6.5¥1.3¥27.0256K$0.97
MiniMax
国内
MiniMax-M3(≤512K)通用高性价比,长上下文¥2.1¥0.42¥8.41M$0.31
小米 MiMo
国内
mimo-v2.6-pro开源旗舰(MIT),原生全模态,Agentic 编程 / 3D 空间推理¥3.0¥0.025(约 0.8%)¥6.01M(输出 ≤131K)$0.435
mimo-v2.6-flash轻量全模态,高并发生成 / 批量处理;开源权重¥1.0¥0.02¥2.01M(输出 ≤131K)$0.14

注 1:OpenAI 价格为标准档(非 Priority/Fast mode);Fast mode 约为标准价 2 倍。
注 2:DeepSeek 为高峰价(UTC 01:00-04:00、06:00-10:00,周一至周五,不含中国法定节假日),其余时段为半价:v4-pro $0.66/$1.98,flash $0.15/$0.60。
注 3:火山方舟另有部分文档刊例价,与模型价格页口径不同,实际以控制台与合同为准。

二、缓存 / 批量 / 长上下文差异

厂商缓存命中价规则缓存写入价Batch 折扣长上下文分层其他溢价
OpenAI标准输入价 10%(Astra/Sol/Terra/Luna 均 0.1×;部分老模型 25%~50%)无单独写入费(自动缓存)5 折(输入+输出)存在 >272K 档位(第三方核对为 2 倍输入)Fast/Priority ≈ 2×;区域处理另计
Anthropic输入价 10%(Fable 5.1 为 2.5%)5m TTL = 1.25× 输入;1h TTL = 2× 输入5 折,可与缓存叠加无:2026-03-13 起取消 >200K 加价,1M 内一口价US-only 推理 1.1×;Opus Fast mode 2×;思考 token 按输出价计
Google输入价 10%;另收缓存存储费(3.1 Pro 约 $4.5/百万 token/小时)隐式缓存写入按存储计费5 折3.1 Pro:≤200K $2/$12,>200K $4/$18(整请求跳档)搜索 grounding:每月 5,000 次免费,超出 $14/千次;思考 token 计入输出
DeepSeek输入价约 2%~3.3%(v4-pro $0.044、flash $0.006)无单独写入费无官方 Batch;用错峰(半价)替代无分层,1M 一口价并发限制:flash 2500 / pro 500
阿里百炼约输入价 12.5%~20%;显式缓存创建 ¥15、命中 ¥1显式缓存创建收费5 折(Batch File / Batch Chat 均半价)plus ≤256K ¥2/¥8,256K-1M ¥6/¥24(3 倍跳档)缓存存储按时长计费;思考模式思维链计入输出
火山方舟约输入价 1/5(pro ¥0.64、lite ¥0.12、mini ¥0.04)无单独写入费无统一 Batch,靠资源包/活动折扣三档跳价:≤32K / 32-128K(1.5×)/ 128-256K(3×)TPM 保障包另计费;深度思考模型长输出价更高(1.8:短输出 ¥2 → 长输出 ¥8)
智谱约输入价 25%~29%(GLM-5.3 ¥2 vs ¥8;5.3-Flash ¥0.23 vs ¥0.8)缓存存储限时免费5 折(Batch API)GLM-5.1 分 [0,32K) / [32K+);5.3 系列 1M 一口价GLM-4.7-Flash 完全免费
Kimi / MiniMax约输入价 10%~20%无单独写入费Kimi 有 Batch 折扣;MiniMax 未明确MiniMax-M3:≤512K ¥2.1/¥8.4,>512K ¥4.2/¥16.8(2 倍)—
小米 MiMo输入价约 0.8%~2%(pro ¥0.025 vs ¥3;flash ¥0.02 vs ¥1)缓存写入限时免费5 折(Batch API;UltraSpeed 不支持)无:1M 上下文一口价,无分层UltraSpeed 超高速模式 ¥30/¥60(缓存命中 ¥0.25);联网插件另计

2.1 Batch 折扣详解

一句话机制:Batch API = 「异步批处理换半价」。你把一批互相独立的请求(JSONL 文件)一次性提交,厂商在队列里调度、用空闲算力处理,24 小时内返回结果文件。代价是放弃实时性,换来输入与输出统一 5 折。三家海外大厂 + 智谱 + 阿里 + 小米 MiMo 完全一致地给 50%,是 LLM 定价里最稳定、无门槛、无需谈判的折扣。

五家规则细节对比(2026-09 核实):

厂商折扣范围完成窗口规模限制结果保留与缓存叠加?关键限制
OpenAI输入+输出各 5 折24h 固定 SLA(超时未完成的请求取消,已完成部分照常计费)单批 ≤5 万请求 / 200MB;2,000 批/小时输出文件保留 30 天部分模型可叠加;Flex 模式是另一条低单价路径不支持流式;batch 限流池与实时限流相互独立;1 条起
Anthropic全部 token 计费项 5 折(含缓存读/写)多数批次 <1 小时;24h 硬上限,过期请求不计费单批 ≤10 万请求 / 256MB结果保留 29 天明确可叠加(批量并发下缓存命中 best-effort,30%~98%)不支持流式;批内请求必须互相独立;不支持 ZDR / Fast mode
Google(Gemini)输入+输出各 5 折目标 24h(多数情况远快于此)文件输入 ≤2GB;inline ≤20MB官方未明确公示显式缓存可叠加;隐式缓存叠加未明确搜索 grounding 等工具费是否随批打折未见说明,按全价预估
阿里百炼Batch Chat 限时 5 折;Batch File 独立刊例价 = 列表价 5 折Batch Chat 同步接口,服务端最长保持连接 1 小时,超时断开且不计费单文件 ≤500MB、单批 ≤1 万请求、并发批任务 ≤1,000—不可叠加:不支持上下文缓存、资源包、节省计划、新人免费额度仅对成功请求计费;高并发选 Batch Chat,大文件异步选 Batch File
智谱标准 API 的 5 折(免费模型不涉及)24h 内完成;超期未完成取消,已完成照常计费单文件 ≤5 万请求 / 100MB;文件保留 30 天30 天缓存存储限时免费,批内缓存规则未见单独说明必须实名认证;部分模型不支持 Batch;限流与实时 API 相互独立

其他厂商:DeepSeek 无官方 Batch,以错峰半价作为替代;火山方舟无统一 Batch 接口;Kimi 有 Batch 折扣;MiniMax 未明确;小米 MiMo 批量 5 折但 UltraSpeed 不支持。

✅ 适合走 Batch

  • 评测集 / 回归测试 / Prompt A/B 打分
  • 夜间批处理:分类、打标、内容审核、工单分诊
  • 文档处理流水线:合同抽取、摘要、翻译、OCR 清洗
  • 语料回填:模型升级后重跑存量数据
  • 合成数据生成、蒸馏语料
  • Agent 的非交互步骤:定时报告、夜间研究汇总

❌ 不适合走 Batch

  • 一切有人在等结果的交互:对话、客服、搜索、copilot
  • 需要流式输出的界面
  • Agent 链式调用中「下一步依赖上一步」的环节
  • 时效不足 1 小时的下游流水线
  • 日请求量极小(低于 100 条)的任务

对成本计算模块的影响(三条必须写进逻辑)

  1. 折扣模型要按厂商参数化:Usage.is_batch 命中时统一 ×0.5 对多家成立,但 DeepSeek 是「按调用时间错峰」而非「提交方式」,火山是「无 Batch」。建议用 batch_discount + off_peak 两个字段,不要用一个布尔值硬编码。
  2. 叠加规则厂商间不一致:Anthropic 批量可叠加缓存(缓存读 0.1× × Batch 0.5×);阿里批处理则明确不支持缓存叠加——「缓存 60% + Batch」的组合对百炼只是理论上限,实际二选一。计算器应内置 stacks_with_cache。
  3. 失败与过期的计费口径不同:阿里「失败/超时不计费」、Anthropic 「过期请求不计费」,而 OpenAI / 智谱 / 阿里 Batch File 是「已完成部分照常计费」。预估按 100% 完成率,但预算要对 24h 高峰期过期的重跑成本留 5%~10% 余量。

本节来源:OpenAI Batch API FAQ;Anthropic Message Batches 文档;阿里云 Batch Chat 使用限制与计费;智谱 Batch API FAQ。核实时间 2026-09-22/23;Anthropic 官方文档存在地区访问限制,部分细节经多个第三方交叉验证。

三、影响实际成本的非价格因素

厂商计价币种免费额度最低消费 / 预付限流与并发
OpenAIUSDAPI 无长期免费额度(新账号可能有小额试用 credit)无最低消费;预付充值制按 usage tier 分级(Tier1→Tier5)提升 RPM/TPM
AnthropicUSD无 API 免费额度(订阅制 Pro/Max 不抵扣 API)无最低消费;高 tier 需预授权/充值RPM / TPM / TPD 三重限制 + 月消费上限 tier;Haiku 默认限额高于 Opus
GoogleUSD有免费档:Flash 系列在限流内免费,但内容会被用于改进产品无最低消费免费档与付费档 RPM/TPM 不同;Vertex AI 另有配额与 PTU
DeepSeekUSD 标价(人民币充值结算)无需先充值余额;无月最低消费并发:v4-pro 500、flash 2500
阿里百炼CNY每模型 100 万 token,有效期 90 天,仅华北 2;Batch/调优/部署不抵扣无最低消费;可选 Token Plan 包月QPS 一般 1~2,单模型周调用上限约 5000 次
火山方舟CNY每模型约 50 万 token,有效期约 30 天;可开「安心模式」用尽即停无最低消费;可选预付费资源包RPM/TPM 保障包可购买;深度思考模型建议流式调用
智谱CNY新用户赠送额度较大;GLM-4.7-Flash / 4.6V-Flash 永久免费无最低消费;云端私有化套餐另报价QPS 约 1~2;免费模型并发 1~5
Kimi / MiniMaxCNY注册赠送(活动期约 800 万 token)无最低消费;未充值状态并发 1、3 次/分钟按账户等级提升并发
小米 MiMoCNY(国内)/ USD(海外)待确认(官方定价页未列免费额度)预付充值制;与 Token Plan 不互通待确认(官方未公示 RPM/并发限制)
汇率提示:2026-09-18 美元/人民币即期约 6.6975(美联储 H.10),2026-09-22 人民币中间价 6.7459。本报告统一按 1 USD = 6.70 CNY 折算。跨币种比价时务必把汇率也做成可配置项,否则 5%~10% 的汇率波动会直接污染成本核算。

四、成本计算模块的数据结构建议

4.1 价格表(可配置项,建议存 JSON/YAML 或数据库表)

{
  "schema_version": "1.0",
  "price_table_version": "2026-09-23",
  "fx": { "USD_CNY": 6.70, "as_of": "2026-09-22", "source": "FRED DEXCHUS" },
  "unit": "price_per_1M_tokens",
  "models": [
    {
      "model_id": "gpt-5.6-sol",
      "vendor": "openai",
      "display_name": "GPT-5.6 Sol",
      "tier": "flagship",
      "currency": "USD",
      "input_price": 4.0,
      "cached_input_price": 0.40,
      "cache_write_price_5m": null,
      "cache_write_price_1h": null,
      "cache_storage_price_per_1M_per_hour": null,
      "output_price": 20.0,
      "batch_discount": 0.5,
      "context_window": 400000,
      "max_output_tokens": 128000,
      "context_tiers": [
        { "max_prompt_tokens": 272000, "input_multiplier": 1.0, "output_multiplier": 1.0 },
        { "max_prompt_tokens": null,   "input_multiplier": 2.0, "output_multiplier": 1.5 }
      ],
      "off_peak": { "enabled": false, "discount": 1.0, "windows_utc": [] },
      "free_quota_tokens": 0,
      "free_quota_days": 0,
      "min_monthly_charge": 0,
      "rate_limit": { "rpm": null, "tpm": null, "concurrency": null },
      "effective_from": "2026-07-30",
      "effective_to": null,
      "source_url": "https://help.openai.com/en/articles/20001415-chatgpt-rate-card-enterprise-token-based-pricing",
      "retrieved_at": "2026-09-23",
      "notes": "Fast/Priority 模式约为标准价 2 倍"
    }
  ]
}

4.2 字段与单位定义

字段类型单位 / 取值说明
model_idstring—业务主键,与调用日志对齐
currencyenumUSD / CNY所有价格字段的原始币种,禁止混存
input_pricedecimal元或美元 / 1M tokens未命中缓存的输入单价
cached_input_pricedecimal同上缓存命中部分单价
cache_write_price_5m / _1hdecimal同上Anthropic 系需要;OpenAI/国产多为 null
cache_storage_price_per_1M_per_hourdecimal元 / 1M tokens / 小时Gemini、百炼显式缓存需要
output_pricedecimal同上输出 token(含思考/推理 token)单价
batch_discountfloat0.5 = 五折作用于输入+输出;无折扣填 1.0
context_tiers[]arraymax_prompt_tokens + 乘数长上下文跳档;注意是「整请求跳档」而非「超出部分」
off_peakobjectdiscount + windows_utcDeepSeek 错峰半价;其他厂商填 enabled=false
free_quota_tokens / _daysinttokens / 天国内厂商免费额度,需在核算时优先抵扣
min_monthly_chargedecimal元多数为 0,私有化/保障包场景非 0
rate_limitobjectrpm / tpm / concurrency用于容量规划与限流告警
effective_from / effective_todateYYYY-MM-DD按调用时间落到对应版本的价格
source_url / retrieved_atstring / date—审计与人工复核入口

4.3 用量侧字段(调用日志 / 账单明细)

{
  "request_id": "...", "model_id": "qwen3.7-plus", "ts": "2026-09-23T10:12:03+08:00",
  "uncached_input_tokens": 4200,   // 未命中缓存的输入 token
  "cached_input_tokens": 8600,     // 命中缓存的输入 token
  "cache_write_tokens": 0,         // 本请求写入缓存的 token(Anthropic 计 1.25x/2x)
  "output_tokens": 980,            // 可见输出
  "reasoning_tokens": 640,         // 思考/推理 token,按输出价计费
  "is_batch": false,               // 是否 Batch 调用(×batch_discount)
  "is_off_peak": false,            // 是否错峰(DeepSeek)
  "prompt_tokens_total": 12800     // 用于命中 context_tiers 判定
}

4.4 计算公式(单次调用)

# 1) 判定长上下文档位(整请求生效)
mult_in, mult_out = pick_tier(prompt_tokens_total, model.context_tiers)   # 默认 (1.0, 1.0)

# 2) 基础费用
cost = (uncached_input_tokens / 1e6) * model.input_price       * mult_in
     + (cached_input_tokens   / 1e6) * model.cached_input_price * mult_in
     + (cache_write_tokens    / 1e6) * model.cache_write_price_5m
     + ((output_tokens + reasoning_tokens) / 1e6) * model.output_price * mult_out

# 3) 叠加折扣
if is_batch:    cost *= model.batch_discount          # 普遍 0.5
if is_off_peak: cost *= model.off_peak.discount       # DeepSeek 0.5

# 4) 币种归一(报表统一到 CNY 或 USD)
cost_cny = cost * fx.USD_CNY if model.currency == "USD" else cost

# 5) 月度聚合 + 免费额度抵扣
monthly = sum(cost_cny) - remaining_free_quota_value(model_id, month)

五、典型用量场景月度成本估算

场景假设:每日 100 万输入 token + 20 万输出 token;每月 30 天 → 输入 3,000 万 token、输出 600 万 token;缓存命中率 0%;非 Batch;均为标准档价格;按稳态月度计。

成本核算最容易踩的坑:长上下文档位按单次请求的输入长度判定,而不是月度累计量。若把「月 3000 万 token」当成一个请求传进计算函数,GPT-5.6 Sol、Gemini 3.1 Pro、MiniMax-M3 等会误触发 2 倍跳档,月成本虚高一倍(实测 GPT-5.6 Sol 从 $240 变 $420)。正确拆分为 3,000 次 ×(10K 输入 / 2K 输出)。
模型月成本(原币)月成本(≈USD)月成本(≈CNY)说明
GPT-6 Astra$600.00$600.00¥4,020顶级旗舰,非必要不选
Claude Fable 5.1$600.00$600.00¥4,020长时程 Agent
GPT-5.5$330.00$330.00¥2,211上一代旗舰,已贵于 Sol
Claude Opus 5.5$240.00$240.00¥1,608—
GPT-5.6 Sol$240.00$240.00¥1,608主力旗舰
GPT-5.4$165.00$165.00¥1,106—
Claude Sonnet 5$180.00$180.00¥1,206已按 2026-09-01 起标准价 $3/$15 计
GPT-5.6 Terra$132.00$132.00¥884—
Gemini 3.1 Pro$132.00$132.00¥884若单次提示 >200K → $228
Gemini 3.5 Flash$99.00$99.00¥663—
Kimi K3¥1,200.00$179.10¥1,200国内旗舰最贵档
GPT-5.4 mini$49.50$49.50¥332—
Gemini 3.8 Flash$45.00$45.00¥302促销价,2027-01-01 翻倍至 $90
qwen3.8-max¥576.00$85.97¥576—
DeepSeek-V4-Pro(高峰)$63.36$63.36¥425错峰半价 → $31.68 / ¥212
Claude Haiku 4.5$60.00$60.00¥402—
GLM-5.3¥408.00$60.90¥408—
Doubao-Seed-Evolving / 2.1-pro¥360.00$53.73¥360—
Gemini 3.5 Flash-Lite$24.00$24.00¥161—
GPT-5.6 Luna$13.20$13.20¥88海外最低档
Doubao-Seed-2.0-lite¥39.60$5.91¥40—
GLM-5.3-Flash(5 折)¥20.40$3.04¥20标准价 ¥40.8
MiniMax-M3¥113.40$16.93¥113—
mimo-v2.6-pro¥126.00$18.81¥126开源旗舰(MIT);缓存命中后可大幅下降
DeepSeek-Flash(高峰)$16.20$16.20¥109错峰半价 → $8.10 / ¥54
qwen3.7-plus(8折后)¥86.40$12.90¥86原价 ¥108;>256K 档 ¥6/¥24
qwen3.8-flash¥40.20$6.00¥40—
mimo-v2.6-flash¥42.00$6.27¥42开源轻量档(MIT)
Doubao-Seed-2.0-mini¥18.00$2.69¥18—
qwen3.7-flash¥10.80$1.61¥11本场景成本地板
GLM-4.7-Flash¥0.00$0.00¥0免费档(有并发限制)

5.1 三个「降本开关」的实测效果(以 qwen3.8-max 为例)

方案月成本降幅计算过程
基线(无优化)¥576—30M×¥12 + 6M×¥36
+ 缓存命中率 60%¥387-33%12M×¥12 + 18M×¥1.5 + 6M×¥36 = 144+27+216
+ Batch 五折¥288-50%全量走离线 Batch
缓存 60% + Batch¥193.5-66%(144+27+216) × 0.5
换成 qwen3.8-flash¥40.2-93%30M×¥0.8 + 6M×¥2.7
成本模型的三个高杠杆(按优先级):① 模型分级路由(简单任务走 flash/mini 档,可降 80%~95%);② 提示词缓存(系统提示词与知识库固定时降 30%~60%);③ 非实时任务走 Batch(直接 5 折)。压榨输出长度(限 max_tokens、关闭不必要的思考链)属于第四项。

5.2 全模型成本排序表(从低到高)

排序口径:统一按「典型场景月度成本」排序——月输入 3,000 万 token + 月输出 600 万 token(缓存命中率 0%、非 Batch、标准档、稳态不含免费额度与最低消费),海外价格按 1 USD = 6.70 CNY 折算为人民币后排序。DeepSeek 取高峰价。

#模型厂商月成本(≈CNY)月成本(原币)输入价 /1M缓存命中 /1M输出价 /1M
1GLM-4.7-Flash智谱¥0.00¥0.00¥0¥0¥0
2qwen3.7-flash阿里通义¥10.80¥10.80¥0.20¥0.04¥0.80
3Doubao-Seed-2.0-mini字节豆包¥18.00¥18.00¥0.20¥0.04¥2.00
4GLM-5.3-Flash智谱¥20.40¥20.40¥0.40(5折)¥0.115¥1.40(5折)
5Doubao-Seed-2.0-lite字节豆包¥39.60¥39.60¥0.60¥0.12¥3.60
6qwen3.8-flash阿里通义¥40.20¥40.20¥0.80¥0.10¥2.70
7mimo-v2.6-flash小米 MiMo¥42.00¥42.00¥1.00¥0.02¥2.00
8qwen3.7-plus阿里通义¥86.40¥86.40¥1.60(8折)¥0.32¥6.40(8折)
9GPT-5.6 LunaOpenAI¥88.44$13.20$0.20$0.02$1.20
10DeepSeek-FlashDeepSeek¥108.54$16.20$0.30$0.006$1.20
11MiniMax-M3MiniMax¥113.40¥113.40¥2.10¥0.42¥8.40
12mimo-v2.6-pro小米 MiMo¥126.00¥126.00¥3.00¥0.025¥6.00
13Gemini 3.5 Flash-LiteGoogle¥160.80$24.00$0.30$0.03$2.50
14Doubao-Seed-2.0-pro字节豆包¥192.00¥192.00¥3.20¥0.64¥16.00
15qwen3.7-max阿里通义¥288.00¥288.00¥6.00(5折)¥0.60¥18.00(5折)
16Gemini 3.8 FlashGoogle¥301.50$45.00$0.75(促销)$0.075$3.75(促销)
17Kimi K2.7 Code月之暗面¥357.00¥357.00¥6.50¥1.30¥27.00
18Doubao-Seed-2.1-pro字节豆包¥360.00¥360.00¥6.00≈¥1.20¥30.00
19Claude Haiku 4.5Anthropic¥402.00$60.00$1.00$0.10$5.00
20GLM-5.3智谱¥408.00¥408.00¥8.00¥2.00¥28.00
21DeepSeek-V4-ProDeepSeek¥424.51$63.36$1.32$0.044$3.96
22Gemini 3.5 FlashGoogle¥663.30$99.00$1.50$0.15$9.00
23qwen3.8-max阿里通义¥576.00¥576.00¥12.00¥1.50¥36.00
24GPT-5.6 TerraOpenAI¥884.40$132.00$2.00$0.20$12.00
25Gemini 3.1 ProGoogle¥884.40$132.00$2.00$0.20$12.00
26Kimi K3月之暗面¥1,200.00¥1,200.00¥20.00¥2.00¥100.00
27Claude Sonnet 5Anthropic¥1,206.00$180.00$3.00$0.30$15.00
28GPT-5.6 SolOpenAI¥1,608.00$240.00$4.00$0.40$20.00
29Claude Opus 5.5Anthropic¥1,608.00$240.00$4.00$0.20$20.00
30GPT-5.5OpenAI¥2,211.00$330.00$5.00$0.50$30.00
31GPT-6 AstraOpenAI¥4,020.00$600.00$10.00$1.00$50.00
32Claude Fable 5.1Anthropic¥4,020.00$600.00$10.00$0.25$50.00

排序说明:① 按「典型场景月度成本」统一折算 CNY 后升序,输入/输出权重天然反映该场景的 30M : 6M 用量结构;若你的场景输出占比更高,输出单价贵的模型排名会下移。② 同价模型排名并列。③ 备选口径:若按「混合单价」(3:1 输入输出加权)排序,名次会略有差异(例如 mimo-v2.6-pro 因缓存命中价极低,在 Agent 类高缓存场景的实际排名会显著上升)。④ 未计入免费额度、资源包、节省计划与企业协议折扣。

5.3 各模型使用场景与优劣势

按 5.2 成本排序顺序列出(从最便宜到最贵)。场景与优劣势为基于官方能力说明与公开评测的定性判断,供选型参考;同一档位内最终选择仍需结合你的实际评测效果。

#模型(厂商)典型使用场景优势劣势
1GLM-4.7-Flash(智谱)原型验证、个人项目、教学演示、低优先级离线任务完全免费、零成本试错;200K 上下文够用;国内直连稳定免费档并发极低(1~5)、高峰排队;不能承载生产核心链路;无 SLA
2qwen3.7-flash(阿里)分类 / 抽取 / 路由 / 内容审核、大批量轻量任务本场景成本地板(¥0.2/¥0.8);1M 上下文;百炼工具链完善复杂推理弱;QPS 仅 1~2;免费额度仅 90 天
3Doubao-Seed-2.0-mini(豆包)大批量简单生成、低时延对话入口、预处理/过滤便宜 + 国内节点低延迟;火山 guardrails 成熟≤32K 档上下文限制;推理与知识深度弱;无统一 Batch
4GLM-5.3-Flash(智谱)中小应用主力、多模态普惠场景、教育/办公5 折后性价比突出;多模态;缓存存储限时免费折扣限时;缓存命中价偏高(输入价约 29%)
5Doubao-Seed-2.0-lite(豆包)高吞吐日常负载、全模态理解(图/语音)、客服全模态输入;价格低;火山企业服务完善长输入三档跳价(32-128K 即 1.5×);深度推理有限
6qwen3.8-flash(阿里)生产级低成本主力:RAG 问答、Agent 中枢、文档处理接近旗舰效果;1M 上下文;函数调用/MCP 兼容好复杂推理仍逊 max 档;百炼限流对高并发不友好
7mimo-v2.6-flash(小米)高并发生成、批量处理、多模态轻任务1M 上下文 + MIT 开源可私有化;缓存命中 ¥0.02;Batch 5 折生态新;免费额度与限流待确认;输出 ≤131K
8qwen3.7-plus(阿里)综合主力:办公、Agent、文档处理(≤256K)8 折后国内综合性价比优;1M 上下文;生态完善>256K 跳档 3 倍(¥6/¥24);折扣到期回原价
9GPT-5.6 Luna(OpenAI)海外轻量首选:分类/抽取/路由/翻译海外价格地板;1M 上下文;OpenAI 生态稳定复杂推理弱;数据出境合规需评估;仅 USD 计费
10DeepSeek-Flash(DeepSeek)日常对话、高并发生成、离线批量处理缓存命中 $0.006 全场最低;错峰半价;开源可自部署高峰价格翻倍且延迟上升;无官方 Batch;并发上限 2500
11MiniMax-M3(MiniMax)长上下文通用任务、多模态应用≤512K 一档价格;1M 上下文;高性价比通用档>512K 跳档 2 倍;输出价 ¥8.4 偏高;生态较弱
12mimo-v2.6-pro(小米)开源旗舰替代:全模态 Agent、3D 空间推理、Agentic 编程MIT 可私有化;原生全模态;缓存命中 ¥0.025 极低评测与社区验证少;UltraSpeed 极贵;限流待确认
13Gemini 3.5 Flash-Lite(Google)翻译、抽取、高并发轻任务、多模态理解海外轻量档最低之一;多模态强;1M 上下文推理深度有限;grounding 另计费;国内访问受限
14Doubao-Seed-2.0-pro(豆包)复杂推理、代码、企业级中文任务中文理解强;火山企业合规完善;≤32K 档价格可控长输入逐级跳价至 3×;对标海外旗舰仍有差距
15qwen3.7-max(阿里)旗舰降本档:复杂推理 / Agent / 长文档5 折后旗舰价极具竞争力(¥6/¥18)折扣随时结束(回 ¥12/¥36)
16Gemini 3.8 Flash(Google)生产级 Agent、文档批处理、多模态促销期海外性价比高;多模态 + 1M 上下文促销价 2026-12-31 到期翻倍;grounding 超额 $14/千次
17Kimi K2.7 Code(月之暗面)编程专用:长上下文代码库理解、Agent coding编码性价比好;256K 长上下文;指令遵循强偏编码垂类;输出 ¥27 偏贵
18Doubao-Seed-2.1-pro / Evolving(豆包)生产级 Coding & Agent 旗舰国内旗舰中 Agent 能力领先;256K~1M 上下文国内旗舰价位;长输入跳档;版本迭代快
19Claude Haiku 4.5(Anthropic)高速低价:分类/路由/客服、海外轻量 AgentAnthropic 系最低价;与 Sonnet/Opus 同 API 可平滑升降级同价位有更便宜替代;200K 上下文较小
20GLM-5.3(智谱)编程 / 复杂推理、国内旗舰、企业私有化国产旗舰编程口碑好;1M 上下文;支持云端私有化缓存命中价高(25%~29%),高缓存场景不占优
21DeepSeek-V4-Pro(DeepSeek)复杂推理 / 编程 / 科研,开源旗舰旗舰效果 + 低价;错峰半价;开源可自部署高峰延迟与价格波动;并发上限 500
22Gemini 3.5 Flash(Google)速度+智能均衡:搜索 grounding、多模态生产多模态 + 搜索 grounding 生态;1M 上下文输出 $9 偏贵(输出/输入 6 倍);国内访问受限
23qwen3.8-max(阿里)最强推理档:复杂 Agent、科研、长文档国产旗舰第一梯队;阿里云合规与企业服务国内旗舰最贵档之一(¥12/¥36);缓存折扣仅 12.5%
24GPT-5.6 Terra(OpenAI)日常生产主力均衡档OpenAI 生态成熟;效果稳定;价格居中>272K 档位加价;数据出境合规风险
25Gemini 3.1 Pro(Google)旗舰推理、长文档、Agent(≤200K 档)$2/$12 的旗舰价优势明显;多模态;Vertex 企业级>200K 整请求跳档($4/$18);思考 token 计入输出
26Kimi K3(月之暗面)软件工程、深度推理、旗舰任务编程与长链推理强;1M 上下文;国内直连输出 ¥100 国内最贵;输出/输入 5 倍,长输出易失控
27Claude Sonnet 5(Anthropic)编码 / 分析 / Agent 主力Agentic coding 标杆;1M 无长上下文加价;MCP 生态成熟2026-09-01 涨价 50%;缓存写入费 1.25×~2×
28GPT-5.6 Sol(OpenAI)复杂 Agent、长链推理主力旗舰旗舰效果;400K 上下文;生态最成熟$4/$20 偏贵;Fast mode 约 2×;思考 token 成本高
29Claude Opus 5.5(Anthropic)复杂 Agentic Coding、企业重度任务顶级 coding / Agent 能力;1M 无加价;缓存读仅 10%$4/$20 高价;默认限流最严;1h 缓存写入 2×
30GPT-5.5(OpenAI)上一代旗舰任务(建议逐步迁移)成熟稳定、生态兼容性最好$5/$30 已贵于新版 Sol
31GPT-6 Astra(OpenAI)超难推理 / 研究级任务当前最强推理之一$10/$50 极贵,非必要不选
32Claude Fable 5.1(Anthropic)长时程 Agent、超高难度任务长时程可靠性最高;缓存读仅 2.5%;1M 无加价标价 $10/$50 极贵;缓存写入 1.25×/2×

口径说明:① 优劣势中的成本评价均基于本报告核实单价(1 USD = 6.70 CNY);② 「缓存」相关评价针对缓存命中占比高的场景(Agent、固定系统提示词、RAG);③ 限时折扣项的优势有效期以「六、价格来源与生效时间」中的到期节点为准。

六、价格来源与生效时间

厂商官方来源链接核实时间已知生效 / 变动节点
OpenAIChatGPT Rate Card · Fast mode · Platform Pricing2026-09-23GPT-5.6 Terra / Luna 于 2026-07-30 降价;Sol 后降至 $4/$20
AnthropicClaude Platform 定价 · Pricing 文档2026-09-23Sonnet 5 促销价至 2026-08-31,2026-09-01 起 $3/$15;2026-03-13 取消 >200K 加价
GoogleGemini API Pricing2026-09-233.7 / 3.8 Flash 促销至 2026-12-31,2027-01-01 起翻倍至 $1.5/$7.5;3.1 Pro >200K 档 $4/$18
DeepSeekModels & Pricing · Rate Limit2026-09-23错峰半价(UTC 01-04 与 06-10,周一至周五);并发 500 / 2500
阿里百炼文本生成模型 · 新人免费额度2026-09-22qwen3.7-max 限时 5 折、3.7-plus 限时 8 折;免费额度 90 天
火山方舟模型费用 · 模型广场2026-09-22Seed 系列迭代频繁(2.0 → 2.1 → Evolving),价格随版本更新
智谱模型 API 价格2026-09-23GLM-5.3-Flash 限时 5 折;Batch API 5 折;缓存存储限时免费
KimiKimi 开放平台2026-09-23K3 新发布,价格以平台展示为准
MiniMaxplatform.minimaxi.com 定价页 / 百炼模型广场2026-09-23M3 按 ≤512K / >512K 两档
小米 MiMoXiaomi MiMo API Pricing2026-09-23V2.6(Pro / Flash)发布并开源(MIT)于 2026-09-22;v2.5 将于 2026-10-21 10:00 下线;缓存写入限时免费
汇率美联储 H.10 / FRED 序列 DEXCHUS(2026-09-18: 6.6975)。官网 fred.stlouisfed.org 国内网络可能无法直连,故不挂链接。2026-09-22人民币中间价 2026-09-22:6.7459

访问说明(2026-09-23 实测):OpenAI help 与 Fast mode 页可访问;Anthropic 定价文档在部分网络会跳转到「App unavailable in region」;Google Gemini 定价页与 FRED 在部分国内网络超时或无法直连—— 链接仍指向官方地址,打不开属网络可达性问题,不代表链接失效。 火山模型费用页会跳转至 docs.volcengine.com 新地址;Kimi 开放平台会跳转至 platform.kimi.com(正文已用新地址)。

工程落地建议:价格表必须可配置
  • 禁止硬编码单价:价格存独立数据源(JSON/YAML/DB 表),代码只依赖 model_id + 调用时间 查询。
  • 版本号 + 生效区间双字段:每次价格变更新增一条记录而非修改原记录,历史账单可复现。
  • 三处必须留兜底:① 找不到 model_id → 拒绝计费并告警;② 命中多条生效记录 → 取 effective_from 最大的一条;③ 汇率缺失 → 冻结上次汇率并告警。
  • 价格巡检自动化:建议每周拉取一次各官方定价页做 diff,变更时发通知(本报告周期内就抓到 Claude Sonnet 5 的 9 月涨价、GPT-5.6 系列的 7 月降价)。
  • 与实际账单对账:厂商返回的 usage 字段(尤其 cached_tokens、 reasoning_tokens)是黄金标准,自估模型只用于预估与告警。
  • 预留扩展字段:cache_storage_price、 tool_price、 regional_multiplier,这些「隐形费用」最容易漏算。

本报告价格均为公开标价,企业协议价、资源包、节省计划、云端私有化套餐均未计入。 价格变动频繁,使用前请以各厂商官方定价页为准。
生成时间:2026-09-23 · 配套文件:model_pricing_2026-09-23.json(可配置价格表)、cost_estimator.py(成本计算示例)

把结论落到工具与流程上

可从 AI 工具库按场景挑工具,或直接约一次需求沟通。