你将学到什么
- 什么是 Kimi K3,它有何不同?
- 底层技术:KDA、注意力残差和 Stable LatentMoE 架构
- 如何使用推理努力、流式输出、工具、视觉和 1M 上下文?
- 如何从首次 API 调用走向生产环境?
- Kimi K3 在编码和智能体基准上与前沿模型相比如何?
- Kimi K3 在 Together AI 上的成本是多少?
Kimi K3 是 Moonshot AI 迄今为止最强大的模型:一个 2.8 万亿参数的模型,也是世界上首个 3 万亿参数级别的开源模型。它专为前沿智能工作设计,如长周期编码、端到端知识工作和深度推理。它也是首个与 GPT 5.6 Sol 和 Claude Fable 5 级别竞争的开放权重模型,Together AI 正与 Moonshot 团队直接合作以提供服务。

已发布的最大开放权重模型
Kimi 团队致力于扩展规模,这一点显而易见:在 2025 年 7 月至 2026 年 7 月的十二个月中,有九个月 Kimi 模型设定了开放模型规模的最高上限。K3 拥有 2.8 万亿参数,是迄今发布的最大开放权重模型。
底层技术
K3 的骨干由两项架构更新组成,两者都旨在帮助信息在更长的序列中更深入地流动到网络中:
Kimi Delta Attention (KDA):一种混合线性注意力机制,为在超长上下文中扩展注意力提供了高效基础。这是首个支持 1M 上下文长度的 Kimi 模型。注意力残差 (AttnRes):选择性地跨模型深度检索表示,而不是均匀累积。

在此基础上,Moonshot 通过 Stable LatentMoE 框架进一步推动了专家混合的稀疏性,高效激活了 896 个专家中的 16 个。在这种稀疏度下,每个 token 激活约 2% 的专家,路由和优化成为首要挑战,因此多项支持技术实现了 2.8T 规模的稳定训练:
分位数平衡:直接从路由器得分分位数推导专家分配,消除了启发式更新和敏感的平衡超参数。每头 Muon:扩展 Muon 优化器以独立优化注意力头,实现更大规模的自适应学习。Sigmoid Tanh 单元 (SiTU):改进激活控制。门控 MLA:提高注意力选择性。

如何在 Together AI 上使用 Kimi K3
API 与 OpenAI 兼容。以下代码片段针对 Together AI,并使用官方 Together Python SDK。
思考努力
K3 可通过顶层 reasoning_effort 字段进行配置。支持三个级别:low、high 和 max,默认值为 max。在 Together 上,也可以通过标准的 reasoning={"enabled": False} 开关关闭思考。
流式输出
流式响应分别提供 reasoning_content(思考轨迹)和最终答案的内容增量。
视觉输入
可以输入多张图像。Moonshot 还发布了一个视觉推理基准,Perception Bench。
视觉限制:
- 图片数量没有限制,但整个请求体必须保持在 100 MB 以下。
- 推荐的最大分辨率:图片为 4K(4096x2160)。更高的分辨率会消耗处理时间和令牌,但不会提高理解能力。
- 令牌成本随分辨率增加。
结构化输出
使用带有 json_schema 和 strict: true 的 response_format 来约束最终的 message.content。
较宽松的 {"type": "json_object"} 模式在 Together 上也适用,当你只需要语法上有效的 JSON 时。无论哪种方式,都要保持 max_tokens 充足:整个思考轨迹在发出第一个受模式约束的令牌之前就被消耗掉了,因此过紧的上限会截断 JSON 而不是推理。
工具和 tool_choice
K3 保持标准的工具选择约束。标准循环:在 tools 中声明函数;当模型返回 tool_calls 时,将完整的助手消息附加到历史记录中,然后为每个调用附加一条带有匹配 tool_call_id 的工具消息,然后再次调用。在第一次轮次使用 tool_choice="required" 强制至少一次工具调用,之后切换回 "auto"。更改 tool_choice 不会使前缀缓存失效。
动态工具加载
你可以将完整的工具定义(完整名称、描述和参数)放在一条带有 tools 字段且没有内容的系统消息中。该工具从该消息的位置开始可用。
关键规则:
- 动态声明使用与顶层 tools 字段完全相同的格式。
- 它们按请求应用,服务器不保留,因此请自己在后续请求历史中保留该消息。保留它既保持了工具的可用性,也保持了缓存的前缀;删除它意味着模型不再能调用该工具,并且更改后的前缀可能错过缓存。
- 将动态声明附加到消息末尾不会影响缓存前缀;删除或修改较早的声明可能会在更改点之后损害缓存命中。

大型工具目录的推荐模式:
对话开始:只声明一个 search_tools 函数(由你的后端实现)加上几个核心工具,并在系统提示中宣传可搜索的领域标签。第一轮:设置 tool_choice: "required" 以强制在回答之前进行检索。按需注入:根据检索结果,通过系统消息插入匹配工具的完整定义。直接调用:模型在后续生成中使用加载的工具。成本权衡:在对话开始前决定 reasoning_effort。
代码示例:
1M 上下文和自动缓存
Together 支持完整的 1M 上下文长度,并且上下文缓存是自动的。保持你的长前缀(系统提示、知识库、仓库转储)在请求之间字节稳定,以便后续调用可以命中缓存。Moonshot 建议将固定的批量上下文(知识文档)放在消息数组的最开头,在系统消息之前,然后将问题和回答附加在后面。
采样参数
采样参数是固定的,你应该在请求中省略它们。该模型使用这些参数进行训练,不支持设置替代参数:
- temperature = 1.0
- top_p = 0.95
- n = 1
- presence_penalty = 0
- frequency_penalty = 0
保留的思考
K3 以保留思考历史模式进行训练,因此轨迹是下一轮所依赖的状态。使用以下内容来保留上一轮的思考令牌,并将其转发到未来的轮次。

删除 reasoning_content 行,并且相同的调用答案每次使用不同的新发明数字。在实际代码中,你永远不会手写轨迹;你重放模型产生的内容,即工具循环中的一行代码:
Kimi K3 定价
Kimi K3 按令牌计费,其中缓存命中输入层奖励稳定的前缀:

需要内化的两个成本方面:
缓存是你的杠杆。 在编码工作负载中,命中率超过 90% 时,有效输入成本趋向于 0.30 美元的下限,但前提是你保持前缀稳定。重构早期消息或工具声明将破坏这一点。推理按输出计费,并且可以调节。 思考令牌是输出令牌,价格为 15 美元/百万,思考不能完全禁用,但 reasoning_effort 现在有三个级别。max 仍然是默认值,因此从不设置该字段的管道每次调用都会支付最大推理费用,包括琐碎的调用。
Kimi K3 基准测试
在整个评估套件中,Kimi K3 取得了前沿水平的数字。它在多个编码和智能体基准测试(SWE Marathon、BrowseComp、DeepSearchQA、AutomationBench、OmniDocBench)上领先,并在其他基准测试上与最强的专有模型保持竞争力,同时明显优于测试的其他开放模型 GLM-5.2。在少数基准测试上,它落后于 Claude Fable 5 和 GPT 5.6 Sol,这与 Moonshot 对模型的定位一致。
以下所有 Kimi K3 结果均使用推理努力设置为 max。
Kimi K3 与前沿模型的比较
聚合基准表只能说明这么多。为了在成本、编码质量和路由行为上进行正面比较,我们在 DeepSWE 上对 Kimi K3 与领先的专有模型进行了测试:
Kimi K3 与 GPT 5.6 Sol 在 DeepSWE 上的对比:成本、编码和路由Kimi K3 与 Claude Fable 5 在 DeepSWE 上的对比:成本和编码
常见问题解答
什么是 Kimi K3? Kimi K3 是 Moonshot AI 的旗舰模型,拥有 2.8 万亿参数,是首个 3 万亿参数级别的开源模型,专为长周期编码、知识工作和推理而构建。
Kimi K3 是开源的吗?
是的。它以开放权重模型的形式发布,Together AI 与 Moonshot 团队直接合作提供服务。
Kimi K3 的上下文窗口是多少?
100 万令牌(1,048,576),在 Together AI 上完全支持,并具有自动上下文缓存。
Kimi K3 在 Together AI 上的费用是多少?
缓存命中输入令牌每 100 万 0.30 美元,缓存未命中输入令牌每 100 万 3.00 美元,输出令牌每 100 万 15.00 美元。
可以关闭 Kimi K3 的思考功能吗?
在 Together AI 上,您可以通过 reasoning={"enabled": False} 禁用思考,或者通过将 reasoning_effort 设置为 low、high 或 max 来调节推理深度。
Kimi K3 支持视觉吗?
是的。它具有原生视觉能力,每个请求可接受多张图像,只要请求体总大小保持在 100 MB 以下。
Kimi K3 已在 Together AI 上可用。运行它并将其投入生产。
让 K3 为您所用,从一次 API 调用开始。
- 运行 Kimi K3 推理: Kimi K3 API on Together AI - 开始使用 API 构建:
