DevTk.AI
Kimi K3Moonshot AIAI API 价格1M 上下文Coding Agent

Kimi K3 API 价格与接入指南:$3 输入、1M 上下文、视觉与缓存

Kimi K3 API 官方价格、模型 ID、OpenAI 兼容接入、1M 上下文限制、自动缓存、多模态输入、结构化输出和开源状态。

DevTk.AI 2026-07-19 更新于 2026-07-19 7 分钟阅读

Moonshot AI 在 2026 年 7 月 16 日发布了 Kimi K3。它是一个始终启用推理的 MoE 模型,面向长程 Coding、研究、工具调用和多模态 Agent。

全球 API 价格为:缓存未命中输入 $3.00/百万 token、缓存命中输入 $0.30/百万 token、输出 $15.00/百万 token。中国区 API 对应官方价格为 ¥20/¥2/¥100。本文分开列出两个区域,不做汇率换算。

Kimi K3 价格与限制

项目Kimi K3
API 模型 IDkimi-k3
全球输入$3.00 / 百万 token
全球缓存输入$0.30 / 百万 token
全球输出$15.00 / 百万 token
中国区输入 / 缓存 / 输出¥20 / ¥2 / ¥100 每百万 token
上下文窗口1,048,576 token,输入与输出合计
默认最大生成量131,072 token
可配置最大生成量1,048,576 token
输入文本、图片、视频
工具与输出Function Calling、JSON Mode、严格 JSON Schema
推理始终开启;reasoning_effort: "max"

K3 在整个上下文窗口内使用统一价格,Moonshot 没有公布单独的长上下文溢价。

OpenAI 兼容 API 接入

Kimi 全球 Chat Completions 接口兼容 OpenAI SDK。安装 SDK 后修改 Base URL:

npm install openai
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.MOONSHOT_API_KEY,
  baseURL: "https://api.moonshot.ai/v1",
});

const response = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    {
      role: "user",
      content: "审查这份数据库迁移计划,返回风险最高的三个步骤。",
    },
  ],
  max_completion_tokens: 4096,
});

console.log(response.choices[0].message);

以 Kimi 平台账号显示的端点和密钥为准。全球站与中国站的 API Key 和 Base URL 不要混用。

自动上下文缓存

Kimi API 会自动识别可复用的 Prompt 前缀,不需要创建 Cache ID,也不需要配置 TTL。把系统提示词、工具定义、仓库摘要等稳定内容放在每次请求的开头,更容易命中同一前缀。

Moonshot 表示其 Coding 工作负载的缓存命中率可以超过 90%。这是厂商结果,不是生产保证;实际命中率必须从自己的用量数据中测量。

假设一次任务使用 200 万输入 token 和 50 万输出 token:

  • 没有缓存命中:2 × $3 + 0.5 × $15 = $13.50
  • 90% 输入命中缓存:1.8 × $0.30 + 0.2 × $3 + 0.5 × $15 = $8.64

这个例子中,输出仍然是账单主体。即使缓存效果很好,也要限制没有价值的推理和最终回答长度。

架构与 API 能力

K3 总参数量为 2.8T,每个 token 激活 896 个专家中的 16 个。Moonshot 称它是首个 3T 级开放模型。架构组合了 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE。

对 API 用户更重要的是这些能力:

  • 图片与视频理解
  • Function Calling 和 tool_choice
  • 基于 JSON Schema 的严格结构化输出
  • JSON Mode 和 Partial Mode
  • 大规模工具目录的动态工具加载
  • 自动上下文缓存
  • 1M 上下文窗口

公共 API 目前始终使用最大推理强度,官方 Quickstart 只列出 max。不要因为其他 Kimi 产品有模型选项,就假设 API 已经支持较低推理档。

在多轮对话或工具循环中,下一次请求必须原样回传上一轮完整 assistant message,包括 reasoning_contentcontenttool_calls。Moonshot 提醒,丢失推理历史或在推理链中途切换到 K3,可能让输出变得不稳定。

开放权重状态

Moonshot 宣布将在 2026 年 7 月 27 日前提供 K3 完整权重。本文核验日期是 7 月 19 日,这一日期仍在未来。

这对基础设施规划很重要:K3 已被宣布为开放模型,但目前不能把完整 checkpoint 当作已经可下载,也不能沿用 K2 的许可证推断 K3 的最终许可。7 月 27 日后应重新核对官方 K3 发布页和模型卡。

K3 是最强 Coding 模型吗?

K3 是值得评测的长上下文 Coding 和 Agent 模型,但 Moonshot 自己也在发布文章中说明,它的整体表现仍落后于最强的 Claude Fable 5 和 GPT-5.6 Sol。这个边界比单个榜单第一更适合工程决策。

Kimi 公布的结果包括:使用 mini-SWE-agent 的 DeepSWE 67.3,以及没有额外上下文管理时的 BrowseComp 90.4。不同厂商的 Harness、工具、token 预算和重试策略并不一致,最终仍要用自己的仓库和 Agent Loop 验证。

需要 1M 上下文、超长输出、视觉输入和自动缓存时,可以优先评测 K3。简单任务则应路由到更便宜的模型,避免 $15/M 的输出价格主导账单。

继续对比 GPT-5.6 SolGLM-5.2 与 DeepSeek V4Kimi K2.7 Code,也可以用 AI 价格计算器输入自己的 token 比例。

官方来源核验于 2026 年 7 月 19 日:Kimi K3 发布K3 API Quickstart全球 API 价格中国区 API 价格API 限流

相关文章