返回 文章 apply CMS 文章

Together AI 上线 NVIDIA Nemotron 3 Nano Omni:单一开放模型统一视频、图像、音频和文本推理

Nemotron 3 Nano Omni 是一个 30B 参数(每 token 激活 3B)的开放多模态模型,在 Together AI 上提供生产级推理,支持视频、图像、音频和文本的统一处理。

NVIDIANemotron 3 Nano OmniTogether AI多模态模型
成长分 / 100 77 综合收获、行动、留存与影响

Together AI 上线 NVIDIA Nemotron 3 Nano Omni:单一开放模型统一视频、图像、音频和文本推理
为什么值得读了解如何通过单一模型替代多模型管道,简化智能体应用的架构并降低延迟和错误。

掌握 Together AI 为 Nemotron 3 Nano Omni 提供的托管基础设施和优化,适合从原型到生产的快速扩展。

关键洞察
  1. Nemotron 3 Nano Omni 采用混合 Mamba-Transformer 专家混合(MoE)架构,30B 参数中每 token 仅激活约 3B,并使用多 token 预测(MTP)提升效率。
  2. 模型支持高达 256K token 的共享多模态输入上下文,可在单一推理循环中处理音频、视觉和文本。
  3. Together AI 的堆栈由前沿 AI 系统研究驱动,提供高吞吐量、低成本、低延迟的生产级推理。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:4882

NVIDIA Nemotron™ 3 Nano Omni 现已登陆 Together AI 平台。作为多模态 AI 领域迈出的重要一步,Nemotron 3 Nano Omni 是一个单一、开放的模型,能够跨视频、图像、音频和语言进行推理。对于构建智能体应用的开发者而言,Together AI Dedicated Inference 是快速入门和扩展的最快途径。

为什么选择在 Together AI 上运行

Together AI,作为 AI 原生云,一直是开发者青睐的平台,他们希望以快速、经济、可靠的方式访问全球最佳开放模型,用于生产级推理。

Nemotron 3 Nano Omni 通过执行链式操作来统一跨模态的上下文,这些操作对于需要确定性行为的智能体通常至关重要。这意味着智能体可以同时推理音频输入(例如录音或转录文本)、视觉输入(如截图、视频)以及结构化文档——而无需将这些理解分散到不同的推理过程中。

  1. Together AI 的研究优化释放了模型的全部架构潜力 Nemotron 3 Nano Omni 采用混合 Mamba-Transformer 专家混合(MoE)架构,在总共 30B 参数中,每个 token 仅激活约 3B 参数,并使用多 token 预测(MTP)在单次前向传递中同时生成多个未来 token。Together AI 的堆栈由前沿 AI 系统研究驱动,能够实现高吞吐量、高成本效益、低延迟的生产级推理。将其与全新、高效且高精度的 Nemotron 3 Nano Omni 模型相结合,意味着更快的多模态推理,每单位计算量带来更高的智能。
  2. 为智能体、生产级推理工作负载构建的托管基础设施 智能体应用依赖于可预测的性能。Together AI 在流量高峰、高可用性和 token 流式传输下提供可靠的性能,帮助智能体循环即使在长上下文或连续决策任务中也能保持响应。开发者可以在 Together AI 上快速部署 Nemotron 3 Nano Omni,无需管理基础设施,并从原型无缝扩展到生产。这种完全托管的环境消除了运维开销,使团队能够专注于构建,而非维护 GPU。
  3. 安全、生产就绪的平台,保护您的数据 Together AI 提供简单、开发者友好的 API——使得将 Nemotron 3 Nano Omni 集成到多智能体框架、规划系统和多模态系统中变得容易。结合稳定且安全的 API,该平台为组织提供了大规模部署 AI 的可信基础——而无需为了速度牺牲安全性。

Nemotron 3 Nano Omni 的卓越之处

当今大多数生产 AI 系统通过碎片化的管道处理多模态输入:一个模型处理视觉,另一个处理音频,再一个处理文档——通过自定义编排逻辑拼接在一起。该架构中的每一个接缝都是潜在的故障点——增加的延迟、错位的上下文以及跨模态的复合错误。

Nemotron Nano Omni 消除了这些接缝。

基于专家混合(MoE)架构和混合 Transformer-Mamba 设计,30B A3B 模型在单个连贯的推理循环中支持高达 256K token 的共享多模态输入上下文。这使得智能体能够理解音频输入(例如转录文本)、视觉输入(如截图)以及相关文档——而无需将这些理解分散到不同的推理过程中。

效率优势显著:

  • 减少

减少了对多模型管道的需求,降低了系统复杂性

  • 跨视频、音频和文档工作负载的更高效多模态处理
  • 针对长上下文、智能体应用提高了吞吐量和可扩展性
  • 灵活部署,支持 NVIDIA Hopper、NVIDIA Blackwell 等架构上的 FP8 和 NVFP4 并且它是完全开放的。开放权重、开放数据、开放后训练配方。开发者可以在任何地方部署——云端、本地、离线环境——完全控制数据,无模型锁定。

你可以构建什么

感知与推理的统一模型开启了以前过于复杂或成本过高而无法投入生产的用例:

客户服务智能体可以同时推理通话录音、屏幕录制和政策文档——理解用户意图和系统上下文。

金融分析师智能体推理财报电话音频、投资者演示视频、扫描图表图像和 SEC 文件——产生有依据的洞察,而非表面摘要。

计算机使用智能体通过屏幕录制看到 UI,解释指令,并根据约束文档验证操作——全部在单一推理上下文中完成。

任何以前需要组装多模型堆栈的应用现在都有了更清晰的投产路径。

开始使用

NVIDIA Nemotron 3 Nano Omni 现已在 Together AI 上可用。