Kimi K3 vs GLM-5.2 vs DeepSeek V4:价格与 Agent 路由
对比 Kimi K3、GLM-5.2、DeepSeek V4 Pro 和 V4 Flash 的价格、1M 上下文、缓存、多模态能力与 Coding Agent 定位。
Kimi K3、GLM-5.2 和 DeepSeek V4 都提供约 1M 上下文,但价格和能力位置不同。K3 是高价多模态、超长输出路线;GLM-5.2 是更便宜的长程工程模型;DeepSeek V4 则把高吞吐文本 Agent 的价格压到了最低档。
价格对比
以下为国际站每百万 token 的 API 价格:
| 模型 | 输入 | 缓存输入 | 输出 | 上下文 | 最大输出 |
|---|---|---|---|---|---|
| Kimi K3 | $3.00 | $0.30 | $15.00 | 1M | 最高 1,048,576 |
| GLM-5.2 | $1.40 | $0.26 | $4.40 | 1M | 128K |
| DeepSeek V4 Pro | $0.435 | $0.003625 | $0.87 | 1M | 384K |
| DeepSeek V4 Flash | $0.14 | $0.0028 | $0.28 | 1M | 128K |
K3 更贵,是因为它瞄准了更广的前沿 Agent 角色,而不是低价路由层。这个溢价是否划算,要看任务完成率,不能只看参数量。
Coding Agent 账单示例
假设一次任务使用 200 万输入和 50 万输出 token,暂不计算缓存:
| 模型 | 单次成本 |
|---|---|
| Kimi K3 | $13.50 |
| GLM-5.2 | $5.00 |
| DeepSeek V4 Pro | $1.305 |
| DeepSeek V4 Flash | $0.42 |
K3 是 GLM-5.2 示例成本的 2.7 倍,也是 DeepSeek V4 Pro 的 10 倍以上。它必须在多模态理解、长输出、工具执行或更少重试上提供可测量优势,才能覆盖差价。
能力差异
Kimi K3
K3 接受文本、图片和视频,支持 Function Calling、严格结构化输出和极长生成。自动前缀缓存没有独立 Cache ID 或 TTL,API 当前始终使用 max 推理。
Moonshot 公布的规模是 2.8T 总参数,每个 token 激活 896 个专家中的 16 个。架构信息可以帮助理解模型,但不是质量保证。
GLM-5.2
GLM-5.2 主打长程 Coding 和 Agent 工作,提供 1M 上下文和 128K 最大输出。它的 $1.40/$4.40 位于中间:输出远低于 K3,但高于 DeepSeek V4。
DeepSeek V4
V4 Flash 适合作为便宜侦察层和高吞吐路由,V4 Pro 更适合困难 Coding 与 Agent 步骤。它们极低的缓存命中价很适合反复发送稳定仓库上下文的工作流。
当前 canonical DeepSeek 条目以文本为主。如果图片或视频输入是核心需求,而不是偶尔交给预处理模型,K3 更合适。
推荐多模型路由
| Agent 步骤 | 建议起点 |
|---|---|
| 文件搜索、分类、日志总结 | DeepSeek V4 Flash |
| 普通代码补丁或工具循环 | DeepSeek V4 Pro 或 GLM-5.2 |
| 超长工程执行 | GLM-5.2 |
| 图片/视频任务或输出超过 384K | Kimi K3 |
| 便宜路线失败后的困难任务 | Kimi K3,再接闭源前沿兜底 |
不要只按榜单排名路由。应该记录首轮成功率、有效工具调用、耗时、重试、缓存命中率、总输出 token 和人工修复分钟数。
总结
K3 不是原始 token 单价的性价比冠军,而是能力扩展项:视觉输入、动态工具和其他模型无法匹配的生成上限。GLM-5.2 是平衡的长程路线,DeepSeek V4 则适合作为文本流量的经济默认值。
继续阅读 K3 API 指南和国产大模型价格对比,再用 AI 价格计算器代入自己的 token 结构。
官方来源核验于 2026 年 7 月 19 日:Kimi K3 发布、K3 API Quickstart、Kimi 全球定价、Z.AI 定价、GLM-5.2 文档和 DeepSeek 定价。