DevTk.AI
AI API 价格战OpenAI 降价DeepSeek V4GPT-5.6 LunaGemini 3.6API 定价

2026 年 8 月 AI API 价格战:OpenAI 降价、DeepSeek V4-0731 与新成本底线

OpenAI 下调 GPT-5.6 Terra 和 Luna,DeepSeek 升级 V4 Flash,Google 发布 Gemini 3.6,Claude Sonnet 5 推出限时价。本文分析 2026 年 8 月 API 价格战对开发者的影响。

DevTk.AI 2026-08-01 8 分钟阅读

2026 年 8 月的 AI API 价格战确实发生了,但不是所有厂商一起无差别降价。OpenAI 做了最激进的永久调整,把 GPT-5.6 Luna 从 $1/$6 降到 $0.20/$1.20 每百万输入/输出 Token。DeepSeek 在基础价不变的情况下升级 V4 Flash checkpoint;Google 用 Gemini 3.6 降低高端 Flash 输出价;Anthropic 则采用 Sonnet 5 限时首发价,而不是永久降价。

现在市场上同时存在三种策略:永久压价、限时拉新价,以及同价升级性能。

到底哪些价格变了

厂商与模型之前参考价当前价变化
OpenAI GPT-5.6 Terra$2.50 输入 / $15 输出$2.00 / $12.00降低 20%
OpenAI GPT-5.6 Luna$1.00 输入 / $6 输出$0.20 / $1.20降低 80%
Google Gemini 3.5 -> 3.6 Flash$1.50 输入 / $9 输出$1.50 / $7.50输出降低 16.7%
Anthropic Sonnet 4.6 -> Sonnet 5$3 输入 / $15 输出8 月 31 日前 $2 / $10降低 33.3%,但限时
xAI Grok 4.5 缓存输入$0.50 缓存输入$0.30降低 40%
Mistral Small 4$0.10 输入 / $0.30 输出$0.15 / $0.60输入 +50%,输出 +100%

OpenAI 当前 API 价格页已经确认 Terra 和 Luna 新费率。Sol 仍是 $5/$30,所以 GPT-5.6 不再是整齐的 5:2.5:1 阶梯。Luna 的输入和输出都只相当于 Sol 的 4%,但官方上下文仍为 1.05M,最大输出仍为 128K。

Google Gemini 价格页列出的 Gemini 3.6 Flash 为 $1.50/M 输入、$0.15/M 缓存输入、$7.50/M 输出。Anthropic Claude 价格页则明确写明 Sonnet 5 会在 9 月 1 日从 $2/$10 恢复到 $3/$15,因此不能拿 8 月限时价直接做第四季度预算。

DeepSeek 真的发布新模型了吗

DeepSeek 发布的是新 checkpoint,但没有更换公开 API 模型 ID。7 月 31 日起,deepseek-v4-flash 开始提供 DeepSeek-V4-Flash-0731 Public Beta。官方说明架构和模型规模不变,主要增强 Agent、Responses API 和 Codex 类工作流。当前价格仍为 $0.0028/M 缓存输入、$0.14/M 缓存未命中输入、$0.28/M 输出。可查看 DeepSeek 更新日志官方价格表

还要注意一项未来变化。DeepSeek 已宣布会在北京时间 09:00-12:00、14:00-18:00 采用 2 倍计费,但价格页仍标注生效日期待定。现在就说已经涨价不准确,做容量规划时完全忽略也有风险。

如果未来政策按原文生效,一组基础价 $0.42 的 V4 Flash 工作负载全部落在高峰时段时会变成 $0.84。绝对值仍低,但 Batch 调度和多厂商故障转移会更有价值。

新的成本底线

统一按 200 万缓存未命中输入 + 50 万输出 Token、标准短上下文价格计算:

模型成本相对 GPT-5.6 Sol
DeepSeek V4 Flash$0.421.7%
小米 MiMo-V2.5$0.421.7%
Mistral Small 4$0.602.4%
GPT-5.6 Luna$1.004.0%
MiniMax M3$1.204.8%
Gemini 3.5 Flash-Lite$1.857.4%
GLM-5.2$5.0020.0%
Grok 4.5$7.0028.0%
Claude Sonnet 5$9.0036.0%
GPT-5.6 Terra$10.0040.0%
Kimi K3$13.5054.0%
GPT-5.6 Sol$25.00100%

这不是能力榜。便宜模型如果反复重试、输出更长推理轨迹或频繁升级,单次成功任务成本可能更高;高价模型如果一次正确调用替代多次失败调用,也可能更经济。

为什么 Luna 降价影响很大

DeepSeek 和 MiMo 仍然给出了最低的未缓存文本 Token 底价,缓存命中后优势更明显。Luna 的意义不同:它让一个具备 1.05M 上下文的当前 OpenAI 模型进入 MiniMax 和新 Flash-Lite 所在的预算档。

这让只用 OpenAI 的路由方案也更现实:

  1. 抽取、分类、搜索初筛和常规修改先走 Luna。
  2. 普通生产代码和文档工作升级到 Terra。
  3. 只把高影响或失败请求交给 Sol。
  4. 异步流量使用 Batch/Flex,只有延迟价值能支撑 2 倍 Token 价时才使用 Fast mode。

OpenAI 已在 7 月 30 日把 Priority 更名为 Fast mode。名称改变了,服务档位的价格差仍然存在。

价格战也发生在缓存层

只看输入/输出价会漏掉最强折扣:

  • DeepSeek V4 Flash 缓存输入为 $0.0028/M,只是未命中价的 2%。
  • GPT-5.6 缓存读取按输入价 10% 计费,但显式缓存写入为输入价 1.25 倍。
  • Mistral 的缓存输入优惠 90%。
  • Anthropic 缓存读取为基础输入价 10%,5 分钟和 1 小时写入分别为 1.25 倍和 2 倍。
  • Kimi K3 自动上下文缓存为 $0.30/M,缓存未命中输入为 $3/M。

对长期运行的 Agent,缓存写入规则和前缀稳定性往往比 10% 的表面单价差更重要。

开发者现在应该做什么

不要只看价格就迁移。用固定评测集记录单次成功任务成本、p95 延迟、重试率、输出 Token、缓存命中率和工具调用费,然后至少保留两条路由:低价默认模型和质量升级模型。

还要把优惠价当成带日期的配置。Sonnet 5 在 9 月 1 日调价,Qwen3.7 别名优惠没有公布结束日,DeepSeek 高峰倍数也没有公布开始日。这三类价格都应该触发运营提醒,而不是永久写死在预算表里。

可以用 AI 模型价格计算器测试自己的流量,并用 8 月 API 价格对比表查看当前厂商数据。

结论

OpenAI 的确又降价了,最大变化是 Luna 降低 80%,正式进入高频路由价格带。DeepSeek 新的 V4-Flash-0731 checkpoint 在不更换 API ID 的情况下维持最低基础价。Google 和 Anthropic 则分别用更低输出价的 Flash 模型、限时 Sonnet 首发价施加压力。

市场不会收敛到一个模型,而会收敛到多模型路由:价格、缓存规则、上下文门槛、限时优惠和成功率必须一起评估。

相关文章