Kimi K3 API 价格与接入指南:$3 输入、1M 上下文、视觉与缓存
Kimi K3 API 官方价格、模型 ID、OpenAI 兼容接入、1M 上下文限制、自动缓存、多模态输入、结构化输出和开源状态。
Moonshot AI 在 2026 年 7 月 16 日发布了 Kimi K3。它是一个始终启用推理的 MoE 模型,面向长程 Coding、研究、工具调用和多模态 Agent。
全球 API 价格为:缓存未命中输入 $3.00/百万 token、缓存命中输入 $0.30/百万 token、输出 $15.00/百万 token。中国区 API 对应官方价格为 ¥20/¥2/¥100。本文分开列出两个区域,不做汇率换算。
Kimi K3 价格与限制
| 项目 | Kimi K3 |
|---|---|
| API 模型 ID | kimi-k3 |
| 全球输入 | $3.00 / 百万 token |
| 全球缓存输入 | $0.30 / 百万 token |
| 全球输出 | $15.00 / 百万 token |
| 中国区输入 / 缓存 / 输出 | ¥20 / ¥2 / ¥100 每百万 token |
| 上下文窗口 | 1,048,576 token,输入与输出合计 |
| 默认最大生成量 | 131,072 token |
| 可配置最大生成量 | 1,048,576 token |
| 输入 | 文本、图片、视频 |
| 工具与输出 | Function Calling、JSON Mode、严格 JSON Schema |
| 推理 | 始终开启;reasoning_effort: "max" |
K3 在整个上下文窗口内使用统一价格,Moonshot 没有公布单独的长上下文溢价。
OpenAI 兼容 API 接入
Kimi 全球 Chat Completions 接口兼容 OpenAI SDK。安装 SDK 后修改 Base URL:
npm install openai
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.MOONSHOT_API_KEY,
baseURL: "https://api.moonshot.ai/v1",
});
const response = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{
role: "user",
content: "审查这份数据库迁移计划,返回风险最高的三个步骤。",
},
],
max_completion_tokens: 4096,
});
console.log(response.choices[0].message);
以 Kimi 平台账号显示的端点和密钥为准。全球站与中国站的 API Key 和 Base URL 不要混用。
自动上下文缓存
Kimi API 会自动识别可复用的 Prompt 前缀,不需要创建 Cache ID,也不需要配置 TTL。把系统提示词、工具定义、仓库摘要等稳定内容放在每次请求的开头,更容易命中同一前缀。
Moonshot 表示其 Coding 工作负载的缓存命中率可以超过 90%。这是厂商结果,不是生产保证;实际命中率必须从自己的用量数据中测量。
假设一次任务使用 200 万输入 token 和 50 万输出 token:
- 没有缓存命中:
2 × $3 + 0.5 × $15 = $13.50 - 90% 输入命中缓存:
1.8 × $0.30 + 0.2 × $3 + 0.5 × $15 = $8.64
这个例子中,输出仍然是账单主体。即使缓存效果很好,也要限制没有价值的推理和最终回答长度。
架构与 API 能力
K3 总参数量为 2.8T,每个 token 激活 896 个专家中的 16 个。Moonshot 称它是首个 3T 级开放模型。架构组合了 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE。
对 API 用户更重要的是这些能力:
- 图片与视频理解
- Function Calling 和
tool_choice - 基于 JSON Schema 的严格结构化输出
- JSON Mode 和 Partial Mode
- 大规模工具目录的动态工具加载
- 自动上下文缓存
- 1M 上下文窗口
公共 API 目前始终使用最大推理强度,官方 Quickstart 只列出 max。不要因为其他 Kimi 产品有模型选项,就假设 API 已经支持较低推理档。
在多轮对话或工具循环中,下一次请求必须原样回传上一轮完整 assistant message,包括 reasoning_content、content 和 tool_calls。Moonshot 提醒,丢失推理历史或在推理链中途切换到 K3,可能让输出变得不稳定。
开放权重状态
Moonshot 宣布将在 2026 年 7 月 27 日前提供 K3 完整权重。本文核验日期是 7 月 19 日,这一日期仍在未来。
这对基础设施规划很重要:K3 已被宣布为开放模型,但目前不能把完整 checkpoint 当作已经可下载,也不能沿用 K2 的许可证推断 K3 的最终许可。7 月 27 日后应重新核对官方 K3 发布页和模型卡。
K3 是最强 Coding 模型吗?
K3 是值得评测的长上下文 Coding 和 Agent 模型,但 Moonshot 自己也在发布文章中说明,它的整体表现仍落后于最强的 Claude Fable 5 和 GPT-5.6 Sol。这个边界比单个榜单第一更适合工程决策。
Kimi 公布的结果包括:使用 mini-SWE-agent 的 DeepSWE 67.3,以及没有额外上下文管理时的 BrowseComp 90.4。不同厂商的 Harness、工具、token 预算和重试策略并不一致,最终仍要用自己的仓库和 Agent Loop 验证。
需要 1M 上下文、超长输出、视觉输入和自动缓存时,可以优先评测 K3。简单任务则应路由到更便宜的模型,避免 $15/M 的输出价格主导账单。
继续对比 GPT-5.6 Sol、GLM-5.2 与 DeepSeek V4 或 Kimi K2.7 Code,也可以用 AI 价格计算器输入自己的 token 比例。
官方来源核验于 2026 年 7 月 19 日:Kimi K3 发布、K3 API Quickstart、全球 API 价格、中国区 API 价格和 API 限流。