返回 文章 apply CMS 文章

Kimi K3 完整开发者指南:首个开源 3T 级模型的技术解析与实战调用

一文掌握 Kimi K3 的架构创新、API 调用、成本优化与性能基准,快速上手首个开源 3T 级模型。

Kimi K3开源模型Moonshot AITogether AI
成长分 / 100 82 综合收获、行动、留存与影响

Kimi K3 完整开发者指南:首个开源 3T 级模型的技术解析与实战调用
为什么值得读Kimi K3 是首个 3T 级开源模型,了解其技术突破对 AI 开发者至关重要。

指南提供了完整的 API 调用示例和最佳实践,可直接应用于生产环境。

关键洞察
  1. Kimi K3 拥有 2.8 万亿参数,采用 KDA、注意力残差和 Stable LatentMoE 架构,支持 1M 上下文。
  2. API 兼容 OpenAI,支持推理努力调节、流式输出、视觉输入、结构化输出和工具调用。
  3. 定价为缓存命中输入 $0.30/M、未命中 $3.00/M、输出 $15.00/M,缓存是降低成本的关键。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:10456

你将学到什么

  • 什么是 Kimi K3,它有何不同?
  • 底层技术:KDA、注意力残差和 Stable LatentMoE 架构
  • 如何使用推理努力、流式输出、工具、视觉和 1M 上下文?
  • 如何从首次 API 调用走向生产环境?
  • Kimi K3 在编码和智能体基准上与前沿模型相比如何?
  • Kimi K3 在 Together AI 上的成本是多少?

Kimi K3 是 Moonshot AI 迄今为止最强大的模型:一个 2.8 万亿参数的模型,也是世界上首个 3 万亿参数级别的开源模型。它专为前沿智能工作设计,如长周期编码、端到端知识工作和深度推理。它也是首个与 GPT 5.6 Sol 和 Claude Fable 5 级别竞争的开放权重模型,Together AI 正与 Moonshot 团队直接合作以提供服务。

已发布的最大开放权重模型

Kimi 团队致力于扩展规模,这一点显而易见:在 2025 年 7 月至 2026 年 7 月的十二个月中,有九个月 Kimi 模型设定了开放模型规模的最高上限。K3 拥有 2.8 万亿参数,是迄今发布的最大开放权重模型。

底层技术

K3 的骨干由两项架构更新组成,两者都旨在帮助信息在更长的序列中更深入地流动到网络中:

Kimi Delta Attention (KDA):一种混合线性注意力机制,为在超长上下文中扩展注意力提供了高效基础。这是首个支持 1M 上下文长度的 Kimi 模型。注意力残差 (AttnRes):选择性地跨模型深度检索表示,而不是均匀累积。

在此基础上,Moonshot 通过 Stable LatentMoE 框架进一步推动了专家混合的稀疏性,高效激活了 896 个专家中的 16 个。在这种稀疏度下,每个 token 激活约 2% 的专家,路由和优化成为首要挑战,因此多项支持技术实现了 2.8T 规模的稳定训练:

分位数平衡:直接从路由器得分分位数推导专家分配,消除了启发式更新和敏感的平衡超参数。每头 Muon:扩展 Muon 优化器以独立优化注意力头,实现更大规模的自适应学习。Sigmoid Tanh 单元 (SiTU):改进激活控制。门控 MLA:提高注意力选择性。

如何在 Together AI 上使用 Kimi K3

API 与 OpenAI 兼容。以下代码片段针对 Together AI,并使用官方 Together Python SDK。

思考努力

K3 可通过顶层 reasoning_effort 字段进行配置。支持三个级别:low、high 和 max,默认值为 max。在 Together 上,也可以通过标准的 reasoning={"enabled": False} 开关关闭思考。

流式输出

流式响应分别提供 reasoning_content(思考轨迹)和最终答案的内容增量。

视觉输入

可以输入多张图像。Moonshot 还发布了一个视觉推理基准,Perception Bench

视觉限制:

  • 图片数量没有限制,但整个请求体必须保持在 100 MB 以下。
  • 推荐的最大分辨率:图片为 4K(4096x2160)。更高的分辨率会消耗处理时间和令牌,但不会提高理解能力。
  • 令牌成本随分辨率增加。

结构化输出

使用带有 json_schema 和 strict: true 的 response_format 来约束最终的 message.content。

较宽松的 {"type": "json_object"} 模式在 Together 上也适用,当你只需要语法上有效的 JSON 时。无论哪种方式,都要保持 max_tokens 充足:整个思考轨迹在发出第一个受模式约束的令牌之前就被消耗掉了,因此过紧的上限会截断 JSON 而不是推理。

工具和 tool_choice

K3 保持标准的工具选择约束。标准循环:在 tools 中声明函数;当模型返回 tool_calls 时,将完整的助手消息附加到历史记录中,然后为每个调用附加一条带有匹配 tool_call_id 的工具消息,然后再次调用。在第一次轮次使用 tool_choice="required" 强制至少一次工具调用,之后切换回 "auto"。更改 tool_choice 不会使前缀缓存失效。

动态工具加载

你可以将完整的工具定义(完整名称、描述和参数)放在一条带有 tools 字段且没有内容的系统消息中。该工具从该消息的位置开始可用。

关键规则:

  • 动态声明使用与顶层 tools 字段完全相同的格式。
  • 它们按请求应用,服务器不保留,因此请自己在后续请求历史中保留该消息。保留它既保持了工具的可用性,也保持了缓存的前缀;删除它意味着模型不再能调用该工具,并且更改后的前缀可能错过缓存。
  • 将动态声明附加到消息末尾不会影响缓存前缀;删除或修改较早的声明可能会在更改点之后损害缓存命中。

大型工具目录的推荐模式:

对话开始:只声明一个 search_tools 函数(由你的后端实现)加上几个核心工具,并在系统提示中宣传可搜索的领域标签。第一轮:设置 tool_choice: "required" 以强制在回答之前进行检索。按需注入:根据检索结果,通过系统消息插入匹配工具的完整定义。直接调用:模型在后续生成中使用加载的工具。成本权衡:在对话开始前决定 reasoning_effort。

代码示例:

1M 上下文和自动缓存

Together 支持完整的 1M 上下文长度,并且上下文缓存是自动的。保持你的长前缀(系统提示、知识库、仓库转储)在请求之间字节稳定,以便后续调用可以命中缓存。Moonshot 建议将固定的批量上下文(知识文档)放在消息数组的最开头,在系统消息之前,然后将问题和回答附加在后面。

采样参数

采样参数是固定的,你应该在请求中省略它们。该模型使用这些参数进行训练,不支持设置替代参数:

  • temperature = 1.0
  • top_p = 0.95
  • n = 1
  • presence_penalty = 0
  • frequency_penalty = 0

保留的思考

K3 以保留思考历史模式进行训练,因此轨迹是下一轮所依赖的状态。使用以下内容来保留上一轮的思考令牌,并将其转发到未来的轮次。

删除 reasoning_content 行,并且相同的调用答案每次使用不同的新发明数字。在实际代码中,你永远不会手写轨迹;你重放模型产生的内容,即工具循环中的一行代码:

Kimi K3 定价

Kimi K3 按令牌计费,其中缓存命中输入层奖励稳定的前缀:

需要内化的两个成本方面:

缓存是你的杠杆。 在编码工作负载中,命中率超过 90% 时,有效输入成本趋向于 0.30 美元的下限,但前提是你保持前缀稳定。重构早期消息或工具声明将破坏这一点。推理按输出计费,并且可以调节。 思考令牌是输出令牌,价格为 15 美元/百万,思考不能完全禁用,但 reasoning_effort 现在有三个级别。max 仍然是默认值,因此从不设置该字段的管道每次调用都会支付最大推理费用,包括琐碎的调用。

Kimi K3 基准测试

在整个评估套件中,Kimi K3 取得了前沿水平的数字。它在多个编码和智能体基准测试(SWE Marathon、BrowseComp、DeepSearchQA、AutomationBench、OmniDocBench)上领先,并在其他基准测试上与最强的专有模型保持竞争力,同时明显优于测试的其他开放模型 GLM-5.2。在少数基准测试上,它落后于 Claude Fable 5 和 GPT 5.6 Sol,这与 Moonshot 对模型的定位一致。

以下所有 Kimi K3 结果均使用推理努力设置为 max。

Kimi K3 与前沿模型的比较

聚合基准表只能说明这么多。为了在成本、编码质量和路由行为上进行正面比较,我们在 DeepSWE 上对 Kimi K3 与领先的专有模型进行了测试:

Kimi K3 与 GPT 5.6 Sol 在 DeepSWE 上的对比:成本、编码和路由Kimi K3 与 Claude Fable 5 在 DeepSWE 上的对比:成本和编码

常见问题解答

什么是 Kimi K3? Kimi K3 是 Moonshot AI 的旗舰模型,拥有 2.8 万亿参数,是首个 3 万亿参数级别的开源模型,专为长周期编码、知识工作和推理而构建。

Kimi K3 是开源的吗?

是的。它以开放权重模型的形式发布,Together AI 与 Moonshot 团队直接合作提供服务。

Kimi K3 的上下文窗口是多少?

100 万令牌(1,048,576),在 Together AI 上完全支持,并具有自动上下文缓存。

Kimi K3 在 Together AI 上的费用是多少?

缓存命中输入令牌每 100 万 0.30 美元,缓存未命中输入令牌每 100 万 3.00 美元,输出令牌每 100 万 15.00 美元。

可以关闭 Kimi K3 的思考功能吗?

在 Together AI 上,您可以通过 reasoning={"enabled": False} 禁用思考,或者通过将 reasoning_effort 设置为 low、high 或 max 来调节推理深度。

Kimi K3 支持视觉吗?

是的。它具有原生视觉能力,每个请求可接受多张图像,只要请求体总大小保持在 100 MB 以下。

Kimi K3 已在 Together AI 上可用。运行它并将其投入生产。

让 K3 为您所用,从一次 API 调用开始。

阅读文档