2026 年 8 月 AI API 价格战:OpenAI 降价、DeepSeek V4-0731 与新成本底线
OpenAI 下调 GPT-5.6 Terra 和 Luna,DeepSeek 升级 V4 Flash,Google 发布 Gemini 3.6,Claude Sonnet 5 推出限时价。本文分析 2026 年 8 月 API 价格战对开发者的影响。
2026 年 8 月的 AI API 价格战确实发生了,但不是所有厂商一起无差别降价。OpenAI 做了最激进的永久调整,把 GPT-5.6 Luna 从 $1/$6 降到 $0.20/$1.20 每百万输入/输出 Token。DeepSeek 在基础价不变的情况下升级 V4 Flash checkpoint;Google 用 Gemini 3.6 降低高端 Flash 输出价;Anthropic 则采用 Sonnet 5 限时首发价,而不是永久降价。
现在市场上同时存在三种策略:永久压价、限时拉新价,以及同价升级性能。
到底哪些价格变了
| 厂商与模型 | 之前参考价 | 当前价 | 变化 |
|---|---|---|---|
| OpenAI GPT-5.6 Terra | $2.50 输入 / $15 输出 | $2.00 / $12.00 | 降低 20% |
| OpenAI GPT-5.6 Luna | $1.00 输入 / $6 输出 | $0.20 / $1.20 | 降低 80% |
| Google Gemini 3.5 -> 3.6 Flash | $1.50 输入 / $9 输出 | $1.50 / $7.50 | 输出降低 16.7% |
| Anthropic Sonnet 4.6 -> Sonnet 5 | $3 输入 / $15 输出 | 8 月 31 日前 $2 / $10 | 降低 33.3%,但限时 |
| xAI Grok 4.5 缓存输入 | $0.50 缓存输入 | $0.30 | 降低 40% |
| Mistral Small 4 | $0.10 输入 / $0.30 输出 | $0.15 / $0.60 | 输入 +50%,输出 +100% |
OpenAI 当前 API 价格页已经确认 Terra 和 Luna 新费率。Sol 仍是 $5/$30,所以 GPT-5.6 不再是整齐的 5:2.5:1 阶梯。Luna 的输入和输出都只相当于 Sol 的 4%,但官方上下文仍为 1.05M,最大输出仍为 128K。
Google Gemini 价格页列出的 Gemini 3.6 Flash 为 $1.50/M 输入、$0.15/M 缓存输入、$7.50/M 输出。Anthropic Claude 价格页则明确写明 Sonnet 5 会在 9 月 1 日从 $2/$10 恢复到 $3/$15,因此不能拿 8 月限时价直接做第四季度预算。
DeepSeek 真的发布新模型了吗
DeepSeek 发布的是新 checkpoint,但没有更换公开 API 模型 ID。7 月 31 日起,deepseek-v4-flash 开始提供 DeepSeek-V4-Flash-0731 Public Beta。官方说明架构和模型规模不变,主要增强 Agent、Responses API 和 Codex 类工作流。当前价格仍为 $0.0028/M 缓存输入、$0.14/M 缓存未命中输入、$0.28/M 输出。可查看 DeepSeek 更新日志和官方价格表。
还要注意一项未来变化。DeepSeek 已宣布会在北京时间 09:00-12:00、14:00-18:00 采用 2 倍计费,但价格页仍标注生效日期待定。现在就说已经涨价不准确,做容量规划时完全忽略也有风险。
如果未来政策按原文生效,一组基础价 $0.42 的 V4 Flash 工作负载全部落在高峰时段时会变成 $0.84。绝对值仍低,但 Batch 调度和多厂商故障转移会更有价值。
新的成本底线
统一按 200 万缓存未命中输入 + 50 万输出 Token、标准短上下文价格计算:
| 模型 | 成本 | 相对 GPT-5.6 Sol |
|---|---|---|
| DeepSeek V4 Flash | $0.42 | 1.7% |
| 小米 MiMo-V2.5 | $0.42 | 1.7% |
| Mistral Small 4 | $0.60 | 2.4% |
| GPT-5.6 Luna | $1.00 | 4.0% |
| MiniMax M3 | $1.20 | 4.8% |
| Gemini 3.5 Flash-Lite | $1.85 | 7.4% |
| GLM-5.2 | $5.00 | 20.0% |
| Grok 4.5 | $7.00 | 28.0% |
| Claude Sonnet 5 | $9.00 | 36.0% |
| GPT-5.6 Terra | $10.00 | 40.0% |
| Kimi K3 | $13.50 | 54.0% |
| GPT-5.6 Sol | $25.00 | 100% |
这不是能力榜。便宜模型如果反复重试、输出更长推理轨迹或频繁升级,单次成功任务成本可能更高;高价模型如果一次正确调用替代多次失败调用,也可能更经济。
为什么 Luna 降价影响很大
DeepSeek 和 MiMo 仍然给出了最低的未缓存文本 Token 底价,缓存命中后优势更明显。Luna 的意义不同:它让一个具备 1.05M 上下文的当前 OpenAI 模型进入 MiniMax 和新 Flash-Lite 所在的预算档。
这让只用 OpenAI 的路由方案也更现实:
- 抽取、分类、搜索初筛和常规修改先走 Luna。
- 普通生产代码和文档工作升级到 Terra。
- 只把高影响或失败请求交给 Sol。
- 异步流量使用 Batch/Flex,只有延迟价值能支撑 2 倍 Token 价时才使用 Fast mode。
OpenAI 已在 7 月 30 日把 Priority 更名为 Fast mode。名称改变了,服务档位的价格差仍然存在。
价格战也发生在缓存层
只看输入/输出价会漏掉最强折扣:
- DeepSeek V4 Flash 缓存输入为 $0.0028/M,只是未命中价的 2%。
- GPT-5.6 缓存读取按输入价 10% 计费,但显式缓存写入为输入价 1.25 倍。
- Mistral 的缓存输入优惠 90%。
- Anthropic 缓存读取为基础输入价 10%,5 分钟和 1 小时写入分别为 1.25 倍和 2 倍。
- Kimi K3 自动上下文缓存为 $0.30/M,缓存未命中输入为 $3/M。
对长期运行的 Agent,缓存写入规则和前缀稳定性往往比 10% 的表面单价差更重要。
开发者现在应该做什么
不要只看价格就迁移。用固定评测集记录单次成功任务成本、p95 延迟、重试率、输出 Token、缓存命中率和工具调用费,然后至少保留两条路由:低价默认模型和质量升级模型。
还要把优惠价当成带日期的配置。Sonnet 5 在 9 月 1 日调价,Qwen3.7 别名优惠没有公布结束日,DeepSeek 高峰倍数也没有公布开始日。这三类价格都应该触发运营提醒,而不是永久写死在预算表里。
可以用 AI 模型价格计算器测试自己的流量,并用 8 月 API 价格对比表查看当前厂商数据。
结论
OpenAI 的确又降价了,最大变化是 Luna 降低 80%,正式进入高频路由价格带。DeepSeek 新的 V4-Flash-0731 checkpoint 在不更换 API ID 的情况下维持最低基础价。Google 和 Anthropic 则分别用更低输出价的 Flash 模型、限时 Sonnet 首发价施加压力。
市场不会收敛到一个模型,而会收敛到多模型路由:价格、缓存规则、上下文门槛、限时优惠和成功率必须一起评估。