主流大模型 API 计费标准对比(2026-09)
统一口径横比 OpenAI / Anthropic / Google / DeepSeek / 通义 / 豆包 / 智谱 / Kimi / MiniMax / MiMo 的输入、缓存、输出与批量折扣,附典型用量月成本排序与成本计算模块的数据结构建议。
结论先行
- 同代旗舰「输入价」差 10 倍以上:GPT-6 Astra $10/M 输入 vs DeepSeek-V4-Flash $0.30/M,中间档(GPT-5.6 Terra $2、Gemini 3.1 Pro $2、Claude Sonnet 5 $3、Qwen3.7-Plus ¥2≈$0.30)才是多数业务的实际落点。
- 输出价才是成本主角:输出/输入价格比普遍在 3~5 倍(Kimi K3 达 5 倍、Qwen3.8-Max 3 倍、Gemini 3.5 Flash 6 倍)。压成本先压输出(限长、限思考链)而不是压输入。
- 缓存命中价是最猛的杠杆:海外普遍为输入价的 10%,DeepSeek 缓存命中低至 $0.006/M(约原价 2%),国内约 10%~25%。系统提示词固定的场景,缓存能把成本砍掉 60%~90%。
- 批量(Batch)折扣高度一致:全部 5 折(OpenAI / Anthropic / Gemini / 百炼 / 火山 / 智谱)。非实时任务一律走 Batch,是最省事的 50%。
- 长上下文要防「整包跳档」:Gemini 3.1 Pro 超 200K 后 $2→$4 输入、$12→$18 输出;豆包按输入长度三档逐级翻倍;Anthropic 自 2026-03-13 起取消 >200K 加价、1M 内一口价。这些是账单超预期的主要来源。
- 工程上必须把价格表外置:本报告周期内就有多起调价。价格表要做成带
effective_from / effective_to的可配置数据,禁止硬编码。
一、主力文本模型价格对比(统一口径:每 100 万 token)
国内厂商按官方人民币价列出,并在最后一列给出按 6.70 折算的美元参考价;海外厂商同时给出人民币参考价。「—」表示官方未公布或不适用。
| 厂商 | 主力模型 | 定位 / 适用场景 | 输入价 | 缓存命中价 | 输出价 | 上下文 | 美元参考 |
|---|---|---|---|---|---|---|---|
| OpenAI 海外 | GPT-6 Astra | 顶级旗舰,超难推理/研究级任务 | $10.00 | $1.00 | $50.00 | — | $10.00 |
| GPT-5.6 Sol | 主力旗舰,复杂 Agent、长链推理 | $4.00 | $0.40 | $20.00 | 400K | $4.00 | |
| GPT-5.6 Terra | 均衡档,日常生产主力 | $2.00 | $0.20 | $12.00 | — | $2.00 | |
| GPT-5.6 Luna | 轻量高频,分类/抽取/路由 | $0.20 | $0.02 | $1.20 | 1.05M | $0.20 | |
| Anthropic 海外 | Claude Fable 5.1 | 长时程 Agent、超高难度任务 | $10.00 | $0.25 | $50.00 | 1M | $10.00 |
| Claude Opus 5.5 | 复杂 Agentic Coding、企业重度任务 | $4.00 | $0.20 | $20.00 | 1M | $4.00 | |
| Claude Sonnet 5 | 编码/分析/Agent 主力 2026-09-01 起转标准价 | $2.00→$3.00 | $0.20→$0.30 | $10.00→$15.00 | 1M | $3.00 | |
| Claude Haiku 4.5 | 高速低价,分类/路由/客服 | $1.00 | $0.10 | $5.00 | 200K | $1.00 | |
| Google 海外 | Gemini 3.1 Pro | 旗舰推理、长文档、Agent(≤200K 档) | $2.00 | $0.20 | $12.00 | 1M | $2.00 |
| Gemini 3.5 Flash | 速度+智能均衡,grounding 场景 | $1.50 | $0.15 | $9.00 | 1M | $1.50 | |
| Gemini 3.8 / 3.7 Flash | 生产级 Agent、文档批处理 促销价至 2026-12-31 | $0.75 | $0.075 | $3.75 | 1M | $0.75 | |
| Gemini 3.5 Flash-Lite | 翻译/抽取/高并发轻量任务 | $0.30 | $0.03 | $2.50 | 1M | $0.30 | |
| Gemini 2.5 Flash-Lite | 成本地板,摘要/分类 | $0.10 | $0.01 | $0.40 | 1M | $0.10 | |
| DeepSeek 国内 | deepseek-v4-pro | 旗舰混合推理,复杂推理/编程 | $1.32 ≈¥8.84 | $0.044 | $3.96 ≈¥26.5 | 1M | $1.32 |
| deepseek-flash(V4.1-Flash) | 高并发生成、日常对话/批量 | $0.30 ≈¥2.01 | $0.006 | $1.20 ≈¥8.04 | 1M | $0.30 | |
| 阿里通义(百炼) 国内 | qwen3.8-max | 最强推理,对标 GPT-5.5 / Opus 级 | ¥12.0 | ¥1.5 | ¥36.0 | 1M | $1.79 |
| qwen3.7-max | 旗舰降本档,实际 ¥6/¥18 限时5折 | ¥6.0 | ¥0.6 | ¥18.0 | 1M | $0.90 | |
| qwen3.7-plus | 综合主力,办公/Agent/文档(≤256K) 限时8折 | ¥2.0 | ¥0.4 | ¥8.0 | 1M | $0.30 | |
| qwen3.8-flash | 接近旗舰效果的低成本主力 | ¥0.8 | ¥0.1 | ¥2.7 | 1M | $0.12 | |
| qwen3.7-flash | 超低成本,分类/抽取/高并发 | ¥0.2 | ¥0.04 | ¥0.8 | 1M | $0.03 | |
| 字节豆包(火山方舟) 国内 | Doubao-Seed-Evolving / 2.1-pro | Coding & Agent 旗舰,生产级任务 | ¥6.0 | ≈¥1.2 | ¥30.0 | 256K~1M | $0.90 |
| Doubao-Seed-2.1-turbo | 效果/成本均衡 | ¥3.0 | ≈¥0.6 | ¥15.0 | 256K | $0.45 | |
| Doubao-Seed-2.0-pro(≤32K) | 复杂推理;32-128K 档 ¥4.8/¥24 | ¥3.2 | ¥0.64 | ¥16.0 | 256K | $0.48 | |
| Doubao-Seed-2.0-lite(≤32K) | 高吞吐日常负载,全模态理解 | ¥0.6 | ¥0.12 | ¥3.6 | 256K | $0.09 | |
| Doubao-Seed-2.0-mini(≤32K) | 低时延低成本,大批量简单任务 | ¥0.2 | ¥0.04 | ¥2.0 | 256K | $0.03 | |
| 智谱 国内 | GLM-5.3 | 最新旗舰,编程/复杂推理 | ¥8.0 | ¥2.0 | ¥28.0 | 1M | $1.19 |
| GLM-5.3-Flash | 多模态普惠档,折后 ¥0.4/¥1.4 限时5折 | ¥0.8 | ¥0.23 | ¥2.8 | 1M | $0.12 | |
| GLM-4.7-Flash | 免费档,原型验证/低优先任务 | ¥0 | ¥0 | ¥0 | 200K | $0 | |
| 月之暗面 国内 | Kimi K3 | 旗舰,软件工程/深度推理 | ¥20.0 | ¥2.0 | ¥100.0 | 1M | $2.99 |
| Kimi K2.7 Code | 编程专用,长上下文指令遵循 | ¥6.5 | ¥1.3 | ¥27.0 | 256K | $0.97 | |
| MiniMax 国内 | MiniMax-M3(≤512K) | 通用高性价比,长上下文 | ¥2.1 | ¥0.42 | ¥8.4 | 1M | $0.31 |
| 小米 MiMo 国内 | mimo-v2.6-pro | 开源旗舰(MIT),原生全模态,Agentic 编程 / 3D 空间推理 | ¥3.0 | ¥0.025(约 0.8%) | ¥6.0 | 1M(输出 ≤131K) | $0.435 |
| mimo-v2.6-flash | 轻量全模态,高并发生成 / 批量处理;开源权重 | ¥1.0 | ¥0.02 | ¥2.0 | 1M(输出 ≤131K) | $0.14 |
注 1:OpenAI 价格为标准档(非 Priority/Fast mode);Fast mode 约为标准价 2 倍。
注 2:DeepSeek 为高峰价(UTC 01:00-04:00、06:00-10:00,周一至周五,不含中国法定节假日),其余时段为半价:v4-pro $0.66/$1.98,flash $0.15/$0.60。
注 3:火山方舟另有部分文档刊例价,与模型价格页口径不同,实际以控制台与合同为准。
二、缓存 / 批量 / 长上下文差异
| 厂商 | 缓存命中价规则 | 缓存写入价 | Batch 折扣 | 长上下文分层 | 其他溢价 |
|---|---|---|---|---|---|
| OpenAI | 标准输入价 10%(Astra/Sol/Terra/Luna 均 0.1×;部分老模型 25%~50%) | 无单独写入费(自动缓存) | 5 折(输入+输出) | 存在 >272K 档位(第三方核对为 2 倍输入) | Fast/Priority ≈ 2×;区域处理另计 |
| Anthropic | 输入价 10%(Fable 5.1 为 2.5%) | 5m TTL = 1.25× 输入;1h TTL = 2× 输入 | 5 折,可与缓存叠加 | 无:2026-03-13 起取消 >200K 加价,1M 内一口价 | US-only 推理 1.1×;Opus Fast mode 2×;思考 token 按输出价计 |
| 输入价 10%;另收缓存存储费(3.1 Pro 约 $4.5/百万 token/小时) | 隐式缓存写入按存储计费 | 5 折 | 3.1 Pro:≤200K $2/$12,>200K $4/$18(整请求跳档) | 搜索 grounding:每月 5,000 次免费,超出 $14/千次;思考 token 计入输出 | |
| DeepSeek | 输入价约 2%~3.3%(v4-pro $0.044、flash $0.006) | 无单独写入费 | 无官方 Batch;用错峰(半价)替代 | 无分层,1M 一口价 | 并发限制:flash 2500 / pro 500 |
| 阿里百炼 | 约输入价 12.5%~20%;显式缓存创建 ¥15、命中 ¥1 | 显式缓存创建收费 | 5 折(Batch File / Batch Chat 均半价) | plus ≤256K ¥2/¥8,256K-1M ¥6/¥24(3 倍跳档) | 缓存存储按时长计费;思考模式思维链计入输出 |
| 火山方舟 | 约输入价 1/5(pro ¥0.64、lite ¥0.12、mini ¥0.04) | 无单独写入费 | 无统一 Batch,靠资源包/活动折扣 | 三档跳价:≤32K / 32-128K(1.5×)/ 128-256K(3×) | TPM 保障包另计费;深度思考模型长输出价更高(1.8:短输出 ¥2 → 长输出 ¥8) |
| 智谱 | 约输入价 25%~29%(GLM-5.3 ¥2 vs ¥8;5.3-Flash ¥0.23 vs ¥0.8) | 缓存存储限时免费 | 5 折(Batch API) | GLM-5.1 分 [0,32K) / [32K+);5.3 系列 1M 一口价 | GLM-4.7-Flash 完全免费 |
| Kimi / MiniMax | 约输入价 10%~20% | 无单独写入费 | Kimi 有 Batch 折扣;MiniMax 未明确 | MiniMax-M3:≤512K ¥2.1/¥8.4,>512K ¥4.2/¥16.8(2 倍) | — |
| 小米 MiMo | 输入价约 0.8%~2%(pro ¥0.025 vs ¥3;flash ¥0.02 vs ¥1) | 缓存写入限时免费 | 5 折(Batch API;UltraSpeed 不支持) | 无:1M 上下文一口价,无分层 | UltraSpeed 超高速模式 ¥30/¥60(缓存命中 ¥0.25);联网插件另计 |
2.1 Batch 折扣详解
五家规则细节对比(2026-09 核实):
| 厂商 | 折扣范围 | 完成窗口 | 规模限制 | 结果保留 | 与缓存叠加? | 关键限制 |
|---|---|---|---|---|---|---|
| OpenAI | 输入+输出各 5 折 | 24h 固定 SLA(超时未完成的请求取消,已完成部分照常计费) | 单批 ≤5 万请求 / 200MB;2,000 批/小时 | 输出文件保留 30 天 | 部分模型可叠加;Flex 模式是另一条低单价路径 | 不支持流式;batch 限流池与实时限流相互独立;1 条起 |
| Anthropic | 全部 token 计费项 5 折(含缓存读/写) | 多数批次 <1 小时;24h 硬上限,过期请求不计费 | 单批 ≤10 万请求 / 256MB | 结果保留 29 天 | 明确可叠加(批量并发下缓存命中 best-effort,30%~98%) | 不支持流式;批内请求必须互相独立;不支持 ZDR / Fast mode |
| Google(Gemini) | 输入+输出各 5 折 | 目标 24h(多数情况远快于此) | 文件输入 ≤2GB;inline ≤20MB | 官方未明确公示 | 显式缓存可叠加;隐式缓存叠加未明确 | 搜索 grounding 等工具费是否随批打折未见说明,按全价预估 |
| 阿里百炼 | Batch Chat 限时 5 折;Batch File 独立刊例价 = 列表价 5 折 | Batch Chat 同步接口,服务端最长保持连接 1 小时,超时断开且不计费 | 单文件 ≤500MB、单批 ≤1 万请求、并发批任务 ≤1,000 | — | 不可叠加:不支持上下文缓存、资源包、节省计划、新人免费额度 | 仅对成功请求计费;高并发选 Batch Chat,大文件异步选 Batch File |
| 智谱 | 标准 API 的 5 折(免费模型不涉及) | 24h 内完成;超期未完成取消,已完成照常计费 | 单文件 ≤5 万请求 / 100MB;文件保留 30 天 | 30 天 | 缓存存储限时免费,批内缓存规则未见单独说明 | 必须实名认证;部分模型不支持 Batch;限流与实时 API 相互独立 |
其他厂商:DeepSeek 无官方 Batch,以错峰半价作为替代;火山方舟无统一 Batch 接口;Kimi 有 Batch 折扣;MiniMax 未明确;小米 MiMo 批量 5 折但 UltraSpeed 不支持。
✅ 适合走 Batch
- 评测集 / 回归测试 / Prompt A/B 打分
- 夜间批处理:分类、打标、内容审核、工单分诊
- 文档处理流水线:合同抽取、摘要、翻译、OCR 清洗
- 语料回填:模型升级后重跑存量数据
- 合成数据生成、蒸馏语料
- Agent 的非交互步骤:定时报告、夜间研究汇总
❌ 不适合走 Batch
- 一切有人在等结果的交互:对话、客服、搜索、copilot
- 需要流式输出的界面
- Agent 链式调用中「下一步依赖上一步」的环节
- 时效不足 1 小时的下游流水线
- 日请求量极小(低于 100 条)的任务
对成本计算模块的影响(三条必须写进逻辑)
- 折扣模型要按厂商参数化:
Usage.is_batch命中时统一 ×0.5 对多家成立,但 DeepSeek 是「按调用时间错峰」而非「提交方式」,火山是「无 Batch」。建议用batch_discount+off_peak两个字段,不要用一个布尔值硬编码。 - 叠加规则厂商间不一致:Anthropic 批量可叠加缓存(缓存读 0.1× × Batch 0.5×);阿里批处理则明确不支持缓存叠加——「缓存 60% + Batch」的组合对百炼只是理论上限,实际二选一。计算器应内置
stacks_with_cache。 - 失败与过期的计费口径不同:阿里「失败/超时不计费」、Anthropic 「过期请求不计费」,而 OpenAI / 智谱 / 阿里 Batch File 是「已完成部分照常计费」。预估按 100% 完成率,但预算要对 24h 高峰期过期的重跑成本留 5%~10% 余量。
本节来源:OpenAI Batch API FAQ;Anthropic Message Batches 文档;阿里云 Batch Chat 使用限制与计费;智谱 Batch API FAQ。核实时间 2026-09-22/23;Anthropic 官方文档存在地区访问限制,部分细节经多个第三方交叉验证。
三、影响实际成本的非价格因素
| 厂商 | 计价币种 | 免费额度 | 最低消费 / 预付 | 限流与并发 |
|---|---|---|---|---|
| OpenAI | USD | API 无长期免费额度(新账号可能有小额试用 credit) | 无最低消费;预付充值制 | 按 usage tier 分级(Tier1→Tier5)提升 RPM/TPM |
| Anthropic | USD | 无 API 免费额度(订阅制 Pro/Max 不抵扣 API) | 无最低消费;高 tier 需预授权/充值 | RPM / TPM / TPD 三重限制 + 月消费上限 tier;Haiku 默认限额高于 Opus |
| USD | 有免费档:Flash 系列在限流内免费,但内容会被用于改进产品 | 无最低消费 | 免费档与付费档 RPM/TPM 不同;Vertex AI 另有配额与 PTU | |
| DeepSeek | USD 标价(人民币充值结算) | 无 | 需先充值余额;无月最低消费 | 并发:v4-pro 500、flash 2500 |
| 阿里百炼 | CNY | 每模型 100 万 token,有效期 90 天,仅华北 2;Batch/调优/部署不抵扣 | 无最低消费;可选 Token Plan 包月 | QPS 一般 1~2,单模型周调用上限约 5000 次 |
| 火山方舟 | CNY | 每模型约 50 万 token,有效期约 30 天;可开「安心模式」用尽即停 | 无最低消费;可选预付费资源包 | RPM/TPM 保障包可购买;深度思考模型建议流式调用 |
| 智谱 | CNY | 新用户赠送额度较大;GLM-4.7-Flash / 4.6V-Flash 永久免费 | 无最低消费;云端私有化套餐另报价 | QPS 约 1~2;免费模型并发 1~5 |
| Kimi / MiniMax | CNY | 注册赠送(活动期约 800 万 token) | 无最低消费;未充值状态并发 1、3 次/分钟 | 按账户等级提升并发 |
| 小米 MiMo | CNY(国内)/ USD(海外) | 待确认(官方定价页未列免费额度) | 预付充值制;与 Token Plan 不互通 | 待确认(官方未公示 RPM/并发限制) |
四、成本计算模块的数据结构建议
4.1 价格表(可配置项,建议存 JSON/YAML 或数据库表)
{
"schema_version": "1.0",
"price_table_version": "2026-09-23",
"fx": { "USD_CNY": 6.70, "as_of": "2026-09-22", "source": "FRED DEXCHUS" },
"unit": "price_per_1M_tokens",
"models": [
{
"model_id": "gpt-5.6-sol",
"vendor": "openai",
"display_name": "GPT-5.6 Sol",
"tier": "flagship",
"currency": "USD",
"input_price": 4.0,
"cached_input_price": 0.40,
"cache_write_price_5m": null,
"cache_write_price_1h": null,
"cache_storage_price_per_1M_per_hour": null,
"output_price": 20.0,
"batch_discount": 0.5,
"context_window": 400000,
"max_output_tokens": 128000,
"context_tiers": [
{ "max_prompt_tokens": 272000, "input_multiplier": 1.0, "output_multiplier": 1.0 },
{ "max_prompt_tokens": null, "input_multiplier": 2.0, "output_multiplier": 1.5 }
],
"off_peak": { "enabled": false, "discount": 1.0, "windows_utc": [] },
"free_quota_tokens": 0,
"free_quota_days": 0,
"min_monthly_charge": 0,
"rate_limit": { "rpm": null, "tpm": null, "concurrency": null },
"effective_from": "2026-07-30",
"effective_to": null,
"source_url": "https://help.openai.com/en/articles/20001415-chatgpt-rate-card-enterprise-token-based-pricing",
"retrieved_at": "2026-09-23",
"notes": "Fast/Priority 模式约为标准价 2 倍"
}
]
}4.2 字段与单位定义
| 字段 | 类型 | 单位 / 取值 | 说明 |
|---|---|---|---|
| model_id | string | — | 业务主键,与调用日志对齐 |
| currency | enum | USD / CNY | 所有价格字段的原始币种,禁止混存 |
| input_price | decimal | 元或美元 / 1M tokens | 未命中缓存的输入单价 |
| cached_input_price | decimal | 同上 | 缓存命中部分单价 |
| cache_write_price_5m / _1h | decimal | 同上 | Anthropic 系需要;OpenAI/国产多为 null |
| cache_storage_price_per_1M_per_hour | decimal | 元 / 1M tokens / 小时 | Gemini、百炼显式缓存需要 |
| output_price | decimal | 同上 | 输出 token(含思考/推理 token)单价 |
| batch_discount | float | 0.5 = 五折 | 作用于输入+输出;无折扣填 1.0 |
| context_tiers[] | array | max_prompt_tokens + 乘数 | 长上下文跳档;注意是「整请求跳档」而非「超出部分」 |
| off_peak | object | discount + windows_utc | DeepSeek 错峰半价;其他厂商填 enabled=false |
| free_quota_tokens / _days | int | tokens / 天 | 国内厂商免费额度,需在核算时优先抵扣 |
| min_monthly_charge | decimal | 元 | 多数为 0,私有化/保障包场景非 0 |
| rate_limit | object | rpm / tpm / concurrency | 用于容量规划与限流告警 |
| effective_from / effective_to | date | YYYY-MM-DD | 按调用时间落到对应版本的价格 |
| source_url / retrieved_at | string / date | — | 审计与人工复核入口 |
4.3 用量侧字段(调用日志 / 账单明细)
{
"request_id": "...", "model_id": "qwen3.7-plus", "ts": "2026-09-23T10:12:03+08:00",
"uncached_input_tokens": 4200, // 未命中缓存的输入 token
"cached_input_tokens": 8600, // 命中缓存的输入 token
"cache_write_tokens": 0, // 本请求写入缓存的 token(Anthropic 计 1.25x/2x)
"output_tokens": 980, // 可见输出
"reasoning_tokens": 640, // 思考/推理 token,按输出价计费
"is_batch": false, // 是否 Batch 调用(×batch_discount)
"is_off_peak": false, // 是否错峰(DeepSeek)
"prompt_tokens_total": 12800 // 用于命中 context_tiers 判定
}4.4 计算公式(单次调用)
# 1) 判定长上下文档位(整请求生效)
mult_in, mult_out = pick_tier(prompt_tokens_total, model.context_tiers) # 默认 (1.0, 1.0)
# 2) 基础费用
cost = (uncached_input_tokens / 1e6) * model.input_price * mult_in
+ (cached_input_tokens / 1e6) * model.cached_input_price * mult_in
+ (cache_write_tokens / 1e6) * model.cache_write_price_5m
+ ((output_tokens + reasoning_tokens) / 1e6) * model.output_price * mult_out
# 3) 叠加折扣
if is_batch: cost *= model.batch_discount # 普遍 0.5
if is_off_peak: cost *= model.off_peak.discount # DeepSeek 0.5
# 4) 币种归一(报表统一到 CNY 或 USD)
cost_cny = cost * fx.USD_CNY if model.currency == "USD" else cost
# 5) 月度聚合 + 免费额度抵扣
monthly = sum(cost_cny) - remaining_free_quota_value(model_id, month)五、典型用量场景月度成本估算
场景假设:每日 100 万输入 token + 20 万输出 token;每月 30 天 → 输入 3,000 万 token、输出 600 万 token;缓存命中率 0%;非 Batch;均为标准档价格;按稳态月度计。
| 模型 | 月成本(原币) | 月成本(≈USD) | 月成本(≈CNY) | 说明 |
|---|---|---|---|---|
| GPT-6 Astra | $600.00 | $600.00 | ¥4,020 | 顶级旗舰,非必要不选 |
| Claude Fable 5.1 | $600.00 | $600.00 | ¥4,020 | 长时程 Agent |
| GPT-5.5 | $330.00 | $330.00 | ¥2,211 | 上一代旗舰,已贵于 Sol |
| Claude Opus 5.5 | $240.00 | $240.00 | ¥1,608 | — |
| GPT-5.6 Sol | $240.00 | $240.00 | ¥1,608 | 主力旗舰 |
| GPT-5.4 | $165.00 | $165.00 | ¥1,106 | — |
| Claude Sonnet 5 | $180.00 | $180.00 | ¥1,206 | 已按 2026-09-01 起标准价 $3/$15 计 |
| GPT-5.6 Terra | $132.00 | $132.00 | ¥884 | — |
| Gemini 3.1 Pro | $132.00 | $132.00 | ¥884 | 若单次提示 >200K → $228 |
| Gemini 3.5 Flash | $99.00 | $99.00 | ¥663 | — |
| Kimi K3 | ¥1,200.00 | $179.10 | ¥1,200 | 国内旗舰最贵档 |
| GPT-5.4 mini | $49.50 | $49.50 | ¥332 | — |
| Gemini 3.8 Flash | $45.00 | $45.00 | ¥302 | 促销价,2027-01-01 翻倍至 $90 |
| qwen3.8-max | ¥576.00 | $85.97 | ¥576 | — |
| DeepSeek-V4-Pro(高峰) | $63.36 | $63.36 | ¥425 | 错峰半价 → $31.68 / ¥212 |
| Claude Haiku 4.5 | $60.00 | $60.00 | ¥402 | — |
| GLM-5.3 | ¥408.00 | $60.90 | ¥408 | — |
| Doubao-Seed-Evolving / 2.1-pro | ¥360.00 | $53.73 | ¥360 | — |
| Gemini 3.5 Flash-Lite | $24.00 | $24.00 | ¥161 | — |
| GPT-5.6 Luna | $13.20 | $13.20 | ¥88 | 海外最低档 |
| Doubao-Seed-2.0-lite | ¥39.60 | $5.91 | ¥40 | — |
| GLM-5.3-Flash(5 折) | ¥20.40 | $3.04 | ¥20 | 标准价 ¥40.8 |
| MiniMax-M3 | ¥113.40 | $16.93 | ¥113 | — |
| mimo-v2.6-pro | ¥126.00 | $18.81 | ¥126 | 开源旗舰(MIT);缓存命中后可大幅下降 |
| DeepSeek-Flash(高峰) | $16.20 | $16.20 | ¥109 | 错峰半价 → $8.10 / ¥54 |
| qwen3.7-plus(8折后) | ¥86.40 | $12.90 | ¥86 | 原价 ¥108;>256K 档 ¥6/¥24 |
| qwen3.8-flash | ¥40.20 | $6.00 | ¥40 | — |
| mimo-v2.6-flash | ¥42.00 | $6.27 | ¥42 | 开源轻量档(MIT) |
| Doubao-Seed-2.0-mini | ¥18.00 | $2.69 | ¥18 | — |
| qwen3.7-flash | ¥10.80 | $1.61 | ¥11 | 本场景成本地板 |
| GLM-4.7-Flash | ¥0.00 | $0.00 | ¥0 | 免费档(有并发限制) |
5.1 三个「降本开关」的实测效果(以 qwen3.8-max 为例)
| 方案 | 月成本 | 降幅 | 计算过程 |
|---|---|---|---|
| 基线(无优化) | ¥576 | — | 30M×¥12 + 6M×¥36 |
| + 缓存命中率 60% | ¥387 | -33% | 12M×¥12 + 18M×¥1.5 + 6M×¥36 = 144+27+216 |
| + Batch 五折 | ¥288 | -50% | 全量走离线 Batch |
| 缓存 60% + Batch | ¥193.5 | -66% | (144+27+216) × 0.5 |
| 换成 qwen3.8-flash | ¥40.2 | -93% | 30M×¥0.8 + 6M×¥2.7 |
5.2 全模型成本排序表(从低到高)
排序口径:统一按「典型场景月度成本」排序——月输入 3,000 万 token + 月输出 600 万 token(缓存命中率 0%、非 Batch、标准档、稳态不含免费额度与最低消费),海外价格按 1 USD = 6.70 CNY 折算为人民币后排序。DeepSeek 取高峰价。
| # | 模型 | 厂商 | 月成本(≈CNY) | 月成本(原币) | 输入价 /1M | 缓存命中 /1M | 输出价 /1M |
|---|---|---|---|---|---|---|---|
| 1 | GLM-4.7-Flash | 智谱 | ¥0.00 | ¥0.00 | ¥0 | ¥0 | ¥0 |
| 2 | qwen3.7-flash | 阿里通义 | ¥10.80 | ¥10.80 | ¥0.20 | ¥0.04 | ¥0.80 |
| 3 | Doubao-Seed-2.0-mini | 字节豆包 | ¥18.00 | ¥18.00 | ¥0.20 | ¥0.04 | ¥2.00 |
| 4 | GLM-5.3-Flash | 智谱 | ¥20.40 | ¥20.40 | ¥0.40(5折) | ¥0.115 | ¥1.40(5折) |
| 5 | Doubao-Seed-2.0-lite | 字节豆包 | ¥39.60 | ¥39.60 | ¥0.60 | ¥0.12 | ¥3.60 |
| 6 | qwen3.8-flash | 阿里通义 | ¥40.20 | ¥40.20 | ¥0.80 | ¥0.10 | ¥2.70 |
| 7 | mimo-v2.6-flash | 小米 MiMo | ¥42.00 | ¥42.00 | ¥1.00 | ¥0.02 | ¥2.00 |
| 8 | qwen3.7-plus | 阿里通义 | ¥86.40 | ¥86.40 | ¥1.60(8折) | ¥0.32 | ¥6.40(8折) |
| 9 | GPT-5.6 Luna | OpenAI | ¥88.44 | $13.20 | $0.20 | $0.02 | $1.20 |
| 10 | DeepSeek-Flash | DeepSeek | ¥108.54 | $16.20 | $0.30 | $0.006 | $1.20 |
| 11 | MiniMax-M3 | MiniMax | ¥113.40 | ¥113.40 | ¥2.10 | ¥0.42 | ¥8.40 |
| 12 | mimo-v2.6-pro | 小米 MiMo | ¥126.00 | ¥126.00 | ¥3.00 | ¥0.025 | ¥6.00 |
| 13 | Gemini 3.5 Flash-Lite | ¥160.80 | $24.00 | $0.30 | $0.03 | $2.50 | |
| 14 | Doubao-Seed-2.0-pro | 字节豆包 | ¥192.00 | ¥192.00 | ¥3.20 | ¥0.64 | ¥16.00 |
| 15 | qwen3.7-max | 阿里通义 | ¥288.00 | ¥288.00 | ¥6.00(5折) | ¥0.60 | ¥18.00(5折) |
| 16 | Gemini 3.8 Flash | ¥301.50 | $45.00 | $0.75(促销) | $0.075 | $3.75(促销) | |
| 17 | Kimi K2.7 Code | 月之暗面 | ¥357.00 | ¥357.00 | ¥6.50 | ¥1.30 | ¥27.00 |
| 18 | Doubao-Seed-2.1-pro | 字节豆包 | ¥360.00 | ¥360.00 | ¥6.00 | ≈¥1.20 | ¥30.00 |
| 19 | Claude Haiku 4.5 | Anthropic | ¥402.00 | $60.00 | $1.00 | $0.10 | $5.00 |
| 20 | GLM-5.3 | 智谱 | ¥408.00 | ¥408.00 | ¥8.00 | ¥2.00 | ¥28.00 |
| 21 | DeepSeek-V4-Pro | DeepSeek | ¥424.51 | $63.36 | $1.32 | $0.044 | $3.96 |
| 22 | Gemini 3.5 Flash | ¥663.30 | $99.00 | $1.50 | $0.15 | $9.00 | |
| 23 | qwen3.8-max | 阿里通义 | ¥576.00 | ¥576.00 | ¥12.00 | ¥1.50 | ¥36.00 |
| 24 | GPT-5.6 Terra | OpenAI | ¥884.40 | $132.00 | $2.00 | $0.20 | $12.00 |
| 25 | Gemini 3.1 Pro | ¥884.40 | $132.00 | $2.00 | $0.20 | $12.00 | |
| 26 | Kimi K3 | 月之暗面 | ¥1,200.00 | ¥1,200.00 | ¥20.00 | ¥2.00 | ¥100.00 |
| 27 | Claude Sonnet 5 | Anthropic | ¥1,206.00 | $180.00 | $3.00 | $0.30 | $15.00 |
| 28 | GPT-5.6 Sol | OpenAI | ¥1,608.00 | $240.00 | $4.00 | $0.40 | $20.00 |
| 29 | Claude Opus 5.5 | Anthropic | ¥1,608.00 | $240.00 | $4.00 | $0.20 | $20.00 |
| 30 | GPT-5.5 | OpenAI | ¥2,211.00 | $330.00 | $5.00 | $0.50 | $30.00 |
| 31 | GPT-6 Astra | OpenAI | ¥4,020.00 | $600.00 | $10.00 | $1.00 | $50.00 |
| 32 | Claude Fable 5.1 | Anthropic | ¥4,020.00 | $600.00 | $10.00 | $0.25 | $50.00 |
排序说明:① 按「典型场景月度成本」统一折算 CNY 后升序,输入/输出权重天然反映该场景的 30M : 6M 用量结构;若你的场景输出占比更高,输出单价贵的模型排名会下移。② 同价模型排名并列。③ 备选口径:若按「混合单价」(3:1 输入输出加权)排序,名次会略有差异(例如 mimo-v2.6-pro 因缓存命中价极低,在 Agent 类高缓存场景的实际排名会显著上升)。④ 未计入免费额度、资源包、节省计划与企业协议折扣。
5.3 各模型使用场景与优劣势
按 5.2 成本排序顺序列出(从最便宜到最贵)。场景与优劣势为基于官方能力说明与公开评测的定性判断,供选型参考;同一档位内最终选择仍需结合你的实际评测效果。
| # | 模型(厂商) | 典型使用场景 | 优势 | 劣势 |
|---|---|---|---|---|
| 1 | GLM-4.7-Flash(智谱) | 原型验证、个人项目、教学演示、低优先级离线任务 | 完全免费、零成本试错;200K 上下文够用;国内直连稳定 | 免费档并发极低(1~5)、高峰排队;不能承载生产核心链路;无 SLA |
| 2 | qwen3.7-flash(阿里) | 分类 / 抽取 / 路由 / 内容审核、大批量轻量任务 | 本场景成本地板(¥0.2/¥0.8);1M 上下文;百炼工具链完善 | 复杂推理弱;QPS 仅 1~2;免费额度仅 90 天 |
| 3 | Doubao-Seed-2.0-mini(豆包) | 大批量简单生成、低时延对话入口、预处理/过滤 | 便宜 + 国内节点低延迟;火山 guardrails 成熟 | ≤32K 档上下文限制;推理与知识深度弱;无统一 Batch |
| 4 | GLM-5.3-Flash(智谱) | 中小应用主力、多模态普惠场景、教育/办公 | 5 折后性价比突出;多模态;缓存存储限时免费 | 折扣限时;缓存命中价偏高(输入价约 29%) |
| 5 | Doubao-Seed-2.0-lite(豆包) | 高吞吐日常负载、全模态理解(图/语音)、客服 | 全模态输入;价格低;火山企业服务完善 | 长输入三档跳价(32-128K 即 1.5×);深度推理有限 |
| 6 | qwen3.8-flash(阿里) | 生产级低成本主力:RAG 问答、Agent 中枢、文档处理 | 接近旗舰效果;1M 上下文;函数调用/MCP 兼容好 | 复杂推理仍逊 max 档;百炼限流对高并发不友好 |
| 7 | mimo-v2.6-flash(小米) | 高并发生成、批量处理、多模态轻任务 | 1M 上下文 + MIT 开源可私有化;缓存命中 ¥0.02;Batch 5 折 | 生态新;免费额度与限流待确认;输出 ≤131K |
| 8 | qwen3.7-plus(阿里) | 综合主力:办公、Agent、文档处理(≤256K) | 8 折后国内综合性价比优;1M 上下文;生态完善 | >256K 跳档 3 倍(¥6/¥24);折扣到期回原价 |
| 9 | GPT-5.6 Luna(OpenAI) | 海外轻量首选:分类/抽取/路由/翻译 | 海外价格地板;1M 上下文;OpenAI 生态稳定 | 复杂推理弱;数据出境合规需评估;仅 USD 计费 |
| 10 | DeepSeek-Flash(DeepSeek) | 日常对话、高并发生成、离线批量处理 | 缓存命中 $0.006 全场最低;错峰半价;开源可自部署 | 高峰价格翻倍且延迟上升;无官方 Batch;并发上限 2500 |
| 11 | MiniMax-M3(MiniMax) | 长上下文通用任务、多模态应用 | ≤512K 一档价格;1M 上下文;高性价比通用档 | >512K 跳档 2 倍;输出价 ¥8.4 偏高;生态较弱 |
| 12 | mimo-v2.6-pro(小米) | 开源旗舰替代:全模态 Agent、3D 空间推理、Agentic 编程 | MIT 可私有化;原生全模态;缓存命中 ¥0.025 极低 | 评测与社区验证少;UltraSpeed 极贵;限流待确认 |
| 13 | Gemini 3.5 Flash-Lite(Google) | 翻译、抽取、高并发轻任务、多模态理解 | 海外轻量档最低之一;多模态强;1M 上下文 | 推理深度有限;grounding 另计费;国内访问受限 |
| 14 | Doubao-Seed-2.0-pro(豆包) | 复杂推理、代码、企业级中文任务 | 中文理解强;火山企业合规完善;≤32K 档价格可控 | 长输入逐级跳价至 3×;对标海外旗舰仍有差距 |
| 15 | qwen3.7-max(阿里) | 旗舰降本档:复杂推理 / Agent / 长文档 | 5 折后旗舰价极具竞争力(¥6/¥18) | 折扣随时结束(回 ¥12/¥36) |
| 16 | Gemini 3.8 Flash(Google) | 生产级 Agent、文档批处理、多模态 | 促销期海外性价比高;多模态 + 1M 上下文 | 促销价 2026-12-31 到期翻倍;grounding 超额 $14/千次 |
| 17 | Kimi K2.7 Code(月之暗面) | 编程专用:长上下文代码库理解、Agent coding | 编码性价比好;256K 长上下文;指令遵循强 | 偏编码垂类;输出 ¥27 偏贵 |
| 18 | Doubao-Seed-2.1-pro / Evolving(豆包) | 生产级 Coding & Agent 旗舰 | 国内旗舰中 Agent 能力领先;256K~1M 上下文 | 国内旗舰价位;长输入跳档;版本迭代快 |
| 19 | Claude Haiku 4.5(Anthropic) | 高速低价:分类/路由/客服、海外轻量 Agent | Anthropic 系最低价;与 Sonnet/Opus 同 API 可平滑升降级 | 同价位有更便宜替代;200K 上下文较小 |
| 20 | GLM-5.3(智谱) | 编程 / 复杂推理、国内旗舰、企业私有化 | 国产旗舰编程口碑好;1M 上下文;支持云端私有化 | 缓存命中价高(25%~29%),高缓存场景不占优 |
| 21 | DeepSeek-V4-Pro(DeepSeek) | 复杂推理 / 编程 / 科研,开源旗舰 | 旗舰效果 + 低价;错峰半价;开源可自部署 | 高峰延迟与价格波动;并发上限 500 |
| 22 | Gemini 3.5 Flash(Google) | 速度+智能均衡:搜索 grounding、多模态生产 | 多模态 + 搜索 grounding 生态;1M 上下文 | 输出 $9 偏贵(输出/输入 6 倍);国内访问受限 |
| 23 | qwen3.8-max(阿里) | 最强推理档:复杂 Agent、科研、长文档 | 国产旗舰第一梯队;阿里云合规与企业服务 | 国内旗舰最贵档之一(¥12/¥36);缓存折扣仅 12.5% |
| 24 | GPT-5.6 Terra(OpenAI) | 日常生产主力均衡档 | OpenAI 生态成熟;效果稳定;价格居中 | >272K 档位加价;数据出境合规风险 |
| 25 | Gemini 3.1 Pro(Google) | 旗舰推理、长文档、Agent(≤200K 档) | $2/$12 的旗舰价优势明显;多模态;Vertex 企业级 | >200K 整请求跳档($4/$18);思考 token 计入输出 |
| 26 | Kimi K3(月之暗面) | 软件工程、深度推理、旗舰任务 | 编程与长链推理强;1M 上下文;国内直连 | 输出 ¥100 国内最贵;输出/输入 5 倍,长输出易失控 |
| 27 | Claude Sonnet 5(Anthropic) | 编码 / 分析 / Agent 主力 | Agentic coding 标杆;1M 无长上下文加价;MCP 生态成熟 | 2026-09-01 涨价 50%;缓存写入费 1.25×~2× |
| 28 | GPT-5.6 Sol(OpenAI) | 复杂 Agent、长链推理主力旗舰 | 旗舰效果;400K 上下文;生态最成熟 | $4/$20 偏贵;Fast mode 约 2×;思考 token 成本高 |
| 29 | Claude Opus 5.5(Anthropic) | 复杂 Agentic Coding、企业重度任务 | 顶级 coding / Agent 能力;1M 无加价;缓存读仅 10% | $4/$20 高价;默认限流最严;1h 缓存写入 2× |
| 30 | GPT-5.5(OpenAI) | 上一代旗舰任务(建议逐步迁移) | 成熟稳定、生态兼容性最好 | $5/$30 已贵于新版 Sol |
| 31 | GPT-6 Astra(OpenAI) | 超难推理 / 研究级任务 | 当前最强推理之一 | $10/$50 极贵,非必要不选 |
| 32 | Claude Fable 5.1(Anthropic) | 长时程 Agent、超高难度任务 | 长时程可靠性最高;缓存读仅 2.5%;1M 无加价 | 标价 $10/$50 极贵;缓存写入 1.25×/2× |
口径说明:① 优劣势中的成本评价均基于本报告核实单价(1 USD = 6.70 CNY);② 「缓存」相关评价针对缓存命中占比高的场景(Agent、固定系统提示词、RAG);③ 限时折扣项的优势有效期以「六、价格来源与生效时间」中的到期节点为准。
六、价格来源与生效时间
| 厂商 | 官方来源链接 | 核实时间 | 已知生效 / 变动节点 |
|---|---|---|---|
| OpenAI | ChatGPT Rate Card · Fast mode · Platform Pricing | 2026-09-23 | GPT-5.6 Terra / Luna 于 2026-07-30 降价;Sol 后降至 $4/$20 |
| Anthropic | Claude Platform 定价 · Pricing 文档 | 2026-09-23 | Sonnet 5 促销价至 2026-08-31,2026-09-01 起 $3/$15;2026-03-13 取消 >200K 加价 |
| Gemini API Pricing | 2026-09-23 | 3.7 / 3.8 Flash 促销至 2026-12-31,2027-01-01 起翻倍至 $1.5/$7.5;3.1 Pro >200K 档 $4/$18 | |
| DeepSeek | Models & Pricing · Rate Limit | 2026-09-23 | 错峰半价(UTC 01-04 与 06-10,周一至周五);并发 500 / 2500 |
| 阿里百炼 | 文本生成模型 · 新人免费额度 | 2026-09-22 | qwen3.7-max 限时 5 折、3.7-plus 限时 8 折;免费额度 90 天 |
| 火山方舟 | 模型费用 · 模型广场 | 2026-09-22 | Seed 系列迭代频繁(2.0 → 2.1 → Evolving),价格随版本更新 |
| 智谱 | 模型 API 价格 | 2026-09-23 | GLM-5.3-Flash 限时 5 折;Batch API 5 折;缓存存储限时免费 |
| Kimi | Kimi 开放平台 | 2026-09-23 | K3 新发布,价格以平台展示为准 |
| MiniMax | platform.minimaxi.com 定价页 / 百炼模型广场 | 2026-09-23 | M3 按 ≤512K / >512K 两档 |
| 小米 MiMo | Xiaomi MiMo API Pricing | 2026-09-23 | V2.6(Pro / Flash)发布并开源(MIT)于 2026-09-22;v2.5 将于 2026-10-21 10:00 下线;缓存写入限时免费 |
| 汇率 | 美联储 H.10 / FRED 序列 DEXCHUS(2026-09-18: 6.6975)。官网 fred.stlouisfed.org 国内网络可能无法直连,故不挂链接。 | 2026-09-22 | 人民币中间价 2026-09-22:6.7459 |
访问说明(2026-09-23 实测):OpenAI help 与 Fast mode 页可访问;Anthropic 定价文档在部分网络会跳转到「App unavailable in region」;Google Gemini 定价页与 FRED 在部分国内网络超时或无法直连—— 链接仍指向官方地址,打不开属网络可达性问题,不代表链接失效。 火山模型费用页会跳转至 docs.volcengine.com 新地址;Kimi 开放平台会跳转至 platform.kimi.com(正文已用新地址)。
- 禁止硬编码单价:价格存独立数据源(JSON/YAML/DB 表),代码只依赖
model_id + 调用时间查询。 - 版本号 + 生效区间双字段:每次价格变更新增一条记录而非修改原记录,历史账单可复现。
- 三处必须留兜底:① 找不到 model_id → 拒绝计费并告警;② 命中多条生效记录 → 取
effective_from最大的一条;③ 汇率缺失 → 冻结上次汇率并告警。 - 价格巡检自动化:建议每周拉取一次各官方定价页做 diff,变更时发通知(本报告周期内就抓到 Claude Sonnet 5 的 9 月涨价、GPT-5.6 系列的 7 月降价)。
- 与实际账单对账:厂商返回的 usage 字段(尤其
cached_tokens、reasoning_tokens)是黄金标准,自估模型只用于预估与告警。 - 预留扩展字段:
cache_storage_price、tool_price、regional_multiplier,这些「隐形费用」最容易漏算。