返回 文章 apply CMS 文章

Together AI 上线 NVIDIA Nemotron 3 Super:120B 参数混合专家模型,支持百万 Token 上下文

Together AI 上线 NVIDIA Nemotron 3 Super,120B 参数混合 MoE 模型,支持百万 Token 上下文,专为多智能体推理优化。

NVIDIANemotron 3 SuperTogether AI混合专家模型
成长分 / 100 77 综合收获、行动、留存与影响

Together AI 上线 NVIDIA Nemotron 3 Super:120B 参数混合专家模型,支持百万 Token 上下文
为什么值得读了解最新混合 MoE 架构(Transformer + Mamba)如何平衡推理能力与效率。

掌握 100 万 token 上下文窗口对长文档分析、多智能体系统的实际价值。

关键洞察
  1. Nemotron 3 Super 是 120B 参数(12B 活跃)的混合 MoE 模型,结合 Transformer 和 Mamba 架构,通过潜在 MoE 设计以一次推理成本调用四个专家。
  2. 支持 100 万 token 上下文窗口,可处理整个代码库、长智能体轨迹或大型检索负载。
  3. 多 Token 预测训练使生成速度比领先开放模型提高 50% 以上。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:5684

我们很高兴将 NVIDIA Nemotron 3 Super 引入 Together AI(AI 原生云)。Nemotron 3 Super 专为多智能体编排和复杂推理而构建,是一个 120B 参数(12B 活跃)的混合模型,结合了 Transformer 和 Mamba 架构。

在 Together AI 专用推理上运行 Nemotron 3 Super,使工程团队能够在专为高吞吐量推理工作负载设计的托管基础设施上部署这个开放权重的模型。

适用于智能体工作流的架构能力

现代智能体系统需要分析海量文档存储或编排多步骤规划,这要求模型能够在长上下文中保持状态而不牺牲生成速度。Nemotron 3 Super 引入了多项架构创新,使其非常适合这些工作负载:

  • 混合 MoE 架构(Transformer + Mamba):通过将 Mamba 的高效序列处理与 Transformer 注意力相结合,该模型在保持强大推理能力的同时,将活跃参数(120B 中的 12B)控制在可管理范围内,以实现更快的推理。其潜在 MoE 设计使模型能够以一次推理的成本调用四个专家,提高了推理密集型工作负载的效率。
  • 100 万 Token 上下文窗口:100 万 token 的上下文长度允许应用程序处理整个代码库,在长智能体轨迹中保持状态,并将更大的检索负载直接注入提示中。
  • 多 Token 预测:Nemotron 3 Super 经过训练,可以在一次前向传递中同时生成多个 token。对于生成大量输出(如代码生成或结构化响应)的应用程序,这大大降低了生成延迟,与当前领先的开放模型相比,token 生成速度提高了 50% 以上。 为了在 AIME 2025 和 SWE Bench verified 等基准测试中达到领先的准确性,该模型使用了多环境强化学习(RL)和 NVIDIA 生成的高质量合成数据进行训练。由于 NVIDIA 提供了开放权重的模型、数据集和开发配方,工程团队可以完全控制,为特定环境定制和微调模型。

在 Together AI 上运行 Nemotron 3 Super

为一个具有 100 万 token 上下文窗口的 120B 参数混合模型提供服务通常需要跨多个节点的分布式计算。Nemotron 3 Super 通过 Together AI 专用推理提供,提供了一个适合实验和生产规模的基础设施环境,无需 GPU 配置的开销:

  • 单 GPU 部署:该模型经过优化,可在单个 GPU 上运行协作智能体,支持在单个 NVIDIA H200 或 H100 GPU 上部署。Together AI 处理底层基础设施编排,使团队无需直接配置或管理 GPU 即可部署这些工作负载。
  • 研究优化性能:高效运行混合 MoE 架构需要高度调优的服务软件。Together AI 通过 Together 推理引擎和自定义 CUDA 内核加速模型执行。该技术栈帮助团队在实时推理期间实现更低的延迟和更高的吞吐量。
  • 生产级隔离:专用推理在预留硬件上隔离工作负载,以支持可预测的吞吐量和一致的性能。该平台运行在企业级基础设施上,包括 99.9% 正常运行时间 SLA 和 SOC 2 合规性。 开始使用

开发者可以

今天在 Together AI 上使用 Nemotron 3 Super 构建 gin。

运行大上下文推理工作负载、部署多智能体系统以及扩展生产参考,而无需管理 GPU 基础设施。

常见问题解答

什么是 NVIDIA Nemotron 3 Super?

NVIDIA Nemotron 3 Super 是一种混合专家(MoE)推理模型,专为复杂 AI 工作流和多步骤问题解决而设计。它结合了 Transformer 和 Mamba 组件,以提供强大的推理能力和高效的推理。

Nemotron 3 Super 使用什么架构?

Nemotron 3 Super 使用混合专家架构,该架构结合了 Transformer 注意力机制和 Mamba 序列处理。这种设计在保持强大推理性能的同时提高了计算效率。

Nemotron 3 Super 支持多长的上下文长度?

Nemotron 3 Super 支持高达 100 万个 token 的上下文窗口,使应用程序能够分析大型文档集合、维持长时间对话,并将广泛的检索上下文纳入推理工作流。

哪些类型的应用程序可以使用 Nemotron 3 Super?

Nemotron 3 Super 非常适合协调多个智能体或跨大型知识源操作的应用程序。例如,分析和重构代码库的开发者助手、处理大型文档集合的企业系统、对漏洞进行分类或分析系统日志的网络安全工作流,以及根据用户意图将任务路由到专门智能体的编排系统。

开发者如何在 Together AI 上运行 Nemotron 3 Super?

Nemotron 3 Super 通过专用模型推理部署在 Together AI 上。专用部署允许团队在专为生产工作负载设计的预留基础设施上运行模型,并具有可预测的性能。

开发者是否需要管理 GPU?

不需要。Together AI 管理底层基础设施,使开发者能够部署和扩展 AI 工作负载,而无需直接配置 GPU 资源。

为什么在这些工作负载中使用 Together AI?

Together AI 提供专为大规模 AI 系统设计的基础设施,包括可靠的推理、无服务器扩展以及为现代 AI 应用程序管理的托管基础设施。