返回 文章 build CMS 文章

NVIDIA 与 Palantir 如何用 Nemotron 将供应链专家经验编码化

NVIDIA 与 Palantir 用 Foundry 本体、cuOpt 和 Nemotron 后训练,把供应链专家的分配直觉变成可复用的 AI 决策能力。

供应链NVIDIAPalantirNemotron
成长分 / 100 75 综合收获、行动、留存与影响

NVIDIA 与 Palantir 如何用 Nemotron 将供应链专家经验编码化
为什么值得读了解 NVIDIA 如何将供应链中难以量化的专家判断转化为可训练、可评估的 AI 资产。

看到一个小型专用模型(30B)在特定任务上如何超越大一个数量级的通用模型。

关键洞察
  1. 供应链分配不仅是数学优化问题,还依赖邮件、天气、地缘政治等求解器看不到的人类直觉。
  2. Palantir Foundry 的本体将物料、基地、承诺、产能等连接成统一运营视图,为 AI 飞轮奠定数据基础。
  3. cuOpt 解决混合整数线性规划,最小化所有权时间(TOO),并报告起作用的约束,帮助规划者理解权衡。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:16580

NVIDIA 拥有全球规模最大、最复杂的供应链之一,其绩效衡量从晶圆出厂到首个 token 生成。这一时间间隔分为两部分。Time-to-rack 指从硅片离开晶圆厂到组装好的系统抵达数据中心机房的时间。Time-to-token 涵盖此后的一切:电力、冷却、网络,以及使基础设施在第一天就能投入生产的软件栈。

NVIDIA Grace Blackwell NVL72 平台动用了全球数百万个零部件和数千家供应商,最终系统由数十家 OEM 和 ODM 制造。仅一个计算托盘——单个机架十八个托盘之一——就需要两颗 NVIDIA Grace CPU、四颗 NVIDIA Blackwell GPU 和三十二个 HBM3e 堆栈。我们为 Vera Rubin 创建的供应链规模是 Grace Blackwell 的两倍。CPU、GPU 和内存都是关键组件,每种组件的可用性每周都在变化,因此本周阻碍生产的部件下周可能供应充足。每个组件都有自己的物料清单、自己的供应商和自己的交货周期。将其乘以机架中的每个子组件,结果开始看起来不像一条供应链,而更像一个令人生畏的组合数学问题。

合同制造商必须等到所有组件从三个来源之一到达后才能开始组装:直接来自 NVIDIA 的部件、NVIDIA 以寄售方式备货的部件,以及来自供应商的部件。理想情况下,所有组件同时到达,但如果不是,早到的组件就要等待所有迟到的组件。NVIDIA 从制造基地收到物料的那一刻开始计时,直到物料作为子组件或产品离开,这一指标被称为 Time of Ownership (TOO)。

由于可用性高度动态,NVIDIA 必须决定向每个制造基地分配什么物料以及分配多少。这被称为关键物料分配问题,并且每周都需要手动重新处理。分配覆盖当前季度和下一季度,最近的几周已经确定,因此每周的新数据主要改变更远期的安排。

本文主要关注 time-to-rack,压缩它需要四件事:

  • 实时可见性,以便随时定位关键运营瓶颈
  • 冗余,以防单一故障导致生产停滞
  • 可靠性,使上游生产承诺得以兑现
  • 将人类专业知识编码化,使复杂分配决策背后的判断成为持久知识,并随时间不断积累

虽然前三项要求提供了必要的运营基线,但最重大的变革发生在人类专业知识的编码化上。

GB200 NVL72 计算托盘的分解图,展示其内部电路板和处理器模块排列在打开的机架式机箱上方。

图 1. GB200 NVL72 计算托盘需要两颗 Grace CPU、四颗 Blackwell GPU 和三十两个 HBM3e 堆栈,所有这些都是具有动态可用性的关键组件

在 Palantir Foundry 中构建供应链指挥中心

NVIDIA 供应链运营团队与 Palantir 合作,为物料分配决策的每一项输入创建了统一视图。NVIDIA 团队将其称为数字供应链智能指挥中心,它能够呈现风险、阻碍因素以及其他信号,为这些决策提供信息,而这些信息此前可能分散在互不相连的数据源中,不为人知。

视频 1. 面向计算供应链的主权 AI

在底层,Palantir Foundry 提供了运营上下文。本体将物料、制造基地、承诺、产能、分配、生产产出以及非结构化的定性信号连接到一个受治理的数据层中。它由对象和链接而非行和表组成,构成了对运营现实的完整表示。

这种表示使分配规划人员能够模拟和分析许多不同的场景,让他们能够更广泛地访问决策空间,并为 AI 飞轮奠定基础,从而不断积累新知识并随着时间的推移提高绩效。

Palantir Foundry 供应链仪表板显示 842,190 个受限单位、范围内 128 万个库存单位以及 260 个受保护的优先单位。世界地图跟踪实时供应移动和受限站点,相邻面板显示决策队列、运营知识、52 周履约趋势以及产能、运输、良率和承诺风险的热力图。

图 2. Palantir Foundry 中 NVIDIA 供应链的统一运营视图

使用 NVIDIA cuOpt 解决定量问题

在多个制造基地之间分配物料首先是一个定量问题,其公式化始于决策变量:在接下来的时期内,每种受限物料有多少、在何时分配到哪些基地?围绕这些变量的是所有限制答案的因素。这包括每个能够构建给定 Blackwell 子组件的制造商,以及每个基地在物料到达后能够吸收的吞吐量。它还包括每个所需零件的依赖关系图,并沿着链条反向映射,以便求解器知道计算托盘受其最稀缺的输入而非平均输入的限制。这种约束性限制并非固定不变。它在以下方面之间转移:

  • 从一周到下一周的 GPU、CPU 和内存
  • 所有三条供应路线的入库时间
  • 已向客户做出的承诺,这决定了任何一个基地的短缺实际造成的代价
  • 数千个变量和约束归结为每周一次的分配。

NVIDIA cuOpt 是一个用于 GPU 加速决策优化的开源库,可以解决这个问题。它从本体中获取输入,并将结果作为分配决策写回。分配被表述为混合整数线性规划,目标是最小化所有权时间(TOO)。cuOpt 返回的不仅仅是分配本身。它还报告哪些约束是起作用的,因此规划人员可以看到是台湾产能而非内存供应压低了本周的数字。

由于求解速度很快,规划人员还可以探索答案周围的空间。如果本期内存减少百分之十会怎样?如果一个新的制造基地上线会怎样?规划人员不再向求解器寻求答案,而是开始询问它权衡取舍是什么。

数学止步之处

定量优化并不能说明全部问题。NVIDIA 和 Palantir 将历史上的分配决策与实际发生的情况进行了回测,结果揭示了一个 cuOpt 未能捕捉到的人为因素。

规划人员所依据的信息是求解器无法看到的:当周与合作伙伴往来的电子邮件、关键区域预报中的恶劣天气或正在发生的地缘政治事件、最近一次供应商复盘电话会议的记录,以及多年积累的专业知识。这些输入共同形成了一种关于如何为下一阶段分配物料的直觉,而正是这种直觉让人类专家比数学计算更胜一筹。

基于这一认识,NVIDIA 和 Palantir 围绕这些人类专家构建了这套工作流程。它捕捉分配决策、决策背后的理由、预期结果以及实际结果。机构知识由此变为明确、可审查的决策逻辑,而由于这些数据存在于 Ontology 中,它便成为基于专家判断训练 LLM 的基础。

将决策智能编码化

随后,我们对一个开放权重 LLM 进行了后训练,使其能够应用同样的推理并给出建议。在评估了 NVIDIA Nemotron 开放模型之后,我们选择了 Nemotron 3.5 Lightning,因为它专为智能体工作流的执行层而构建。它作为模型系统的一部分执行专门任务,该系统还包括用于编排和通用任务的更大变体。

其混合专家架构有利于实现高效推理,虽然该模型以 300 亿参数、每次前向传播约 30 亿激活参数而言属于轻量级,但它仍然足够大,能够学习一项聚焦的策略。这种规模使后训练循环变得切实可行,因为较小的模型学习更快,且训练和部署所需的算力都远少于更大的同类模型。

由于 Nemotron 是开放的,它可以在你自己的算力边界内进行后训练。任何组织都可以在自己的运营数据上运行同样的飞轮,而无需将数据暴露到外部。该模型从规划人员实际使用的信号中学习:向制造基地提供了多少受限物料、制造商承诺生产多少、最终生产了多少,以及决策时可获得的定性运营证据。

The objective is to codify an allocation policy that can assess production risk, recommend an allocation range, identify the factors behind that recommendation, and explain its reasoning to the supply-chain team.

The same record doubles as the evaluation harness. We replay each decision with only what was knowable that day, hide the outcome, and compare the model’s recommendation against both the planner’s call and what actually happened. The primary question that this evaluation answers is: If this model had been running last month, would it have made the right allocation call?

From Ontology data to a specialized model

The training process starts with operational history in the Palantir Ontology:

匿名化:NeMo Anonymizer在训练前移除个人身份信息并混淆敏感字段。合成数据生成:NeMo Data Designer扩展并平衡示例,使模型不仅能看到常规周,还能看到分配增加、容量限制和中断场景。监督微调:NeMo AutoModel训练一小组 LoRA 适配器参数,而基础权重保持冻结,这减少了训练时间、内存需求和检查点大小。评估:时点回测通过基础模型和微调模型重放相同的历史决策,隔离出训练后新增的部分。

Palantir Autopilot 端到端管理生命周期,从 Ontology 数据启动每个作业,监控部署的自定义 Nemotron 模型,并保持从数据到模型版本再到建议的谱系完整。

部署后,模型读取当前操作上下文,并返回带有理由和相关风险的建议。规划人员审查并做出最终决定。

Palantir Foundry 架构展示了一个决策循环,其中来自 Palantir Ontology 的受治理数据流经 NVIDIA cuOpt 和自定义 Nemotron 3.5 Lightning 模型,到达人类分配规划人员,其输入反馈回本体。Palantir Autopilot 训练管道对数据进行匿名化和扩展,训练模型,并在返回决策循环之前运行时点回测。

图 3. 分配决策和模型训练共享一个受治理的数据层。规划人员的决策成为训练数据,时点回测为每次部署把关

闭环

每次接受、编辑、覆盖和生产结果都会写回 Ontology,不断累积,直到有足够的代表性数据来证明另一次受治理的训练运行是合理的。

未来,这些反馈将用于强化学习。接受和覆盖的建议将形成偏好对,奖励涵盖分配正确性、策略合规性和证据基础。模型从不在生产中自我重新训练。

结果以两种方式复合:规划人员花更少时间重建常规决策,因此他们覆盖更多站点和产品;分配专业知识也成为机构知识,缩短入职时间并在整个组织传播关键学习成果。

训练后交付的成果

NVIDIA 供应链运营团队与 Palantir 合作,指定模型接收什么、可以推荐什么以及这些推荐如何评分。该工作流既成为应用程序,也成为分配决策智能基准。

我们在相同任务和相同评估数据上比较了三个模型:

  • 基础 Nemotron 3.5 Lightning (BF16)
  • Nemotron 3 Ultra (NVFP4)
  • 我们训练后的 Nemotron 3.5 Lightning (BF16)

在开发基准上,训练后的 Lightning 模型达到了 86.7% 的分配决策准确率。Ultra 达到 55.5%,基础 Lightning 为 17.5%。这使得训练后的模型比 Ultra 领先 31.2 个百分点,比其自身基础模型领先 69.2 个百分点。

柱状图比较三个模型在分配建议上的表现。微调后的 Nemotron 3.5 Lightning 表现最佳,准确率为 86.7%,平衡准确率为 58.6%,宏平均 F1 为 57.5%。Nemotron 3 Ultra 的得分分别为 55.5%、42.0% 和 39.5%,而基础版 Nemotron 3.5 Lightning 的得分分别为 17.5%、29.0% 和 13.5%。

图 4. 后训练 Nemotron Lightning 与 Nemotron Ultra 的准确率得分对比

它还在两个对决策类型而非样本进行等权处理的指标上领先。平衡准确率对每个类别的召回率取平均,因此稀有调用与常见调用同等重要:

58.6% 对 Ultra 的 42.0%。宏平均 F1 对每个类别的 F1 取平均,并纳入精确率,因此模型不能通过过度预测稀有类别来抬高召回率:57.5% 对 39.5%。两者都很重要,因为供应受限意味着规划者削减分配的次数远多于增加分配,所以仅凭普通准确率会美化多数类猜测者。

这个教训具体但重要:

在有界分配任务上,一个专门的 30B 模型可以胜过规模大一个数量级以上的通用模型。

这并不意味着较小的模型整体能力更强。它的提升集中在其后训练所针对的领域。尽管进行了微调,未来的生产风险预测仍然困难。专业化改进了决策任务,但未能解决与之相关的所有预测问题。

The LoRA 运行在 2 块 NVIDIA B200 GPU 上几分钟内完成,轻量到足以随着反馈积累而重复。这是实践中的主权 AI:专有供应链数据、模型权重和推理都保留在单一受治理的环境中。这个 AI 堆栈可以部署在本地或云端,使组织能够在数据、系统和运营需求要求的地方运行 AI。

一个会学习的供应链

本文讨论的供应链工作流并非半导体独有。任何由经验丰富的人员根据碎片化信号分配关键产能的运营,都可以运行同样的飞轮,并针对新领域进行调整。

这需要三个基本要素:

  • 一个受治理的运营层
  • 包含理由和结果的决策捕获
  • 一个可以在你自己的安全计算边界内进行后训练的开放模型

运营数据训练模型,模型改进决策,决策成为下一轮受治理训练的新运营数据。这就是 NVIDIA 和 Palantir 如何压缩从晶圆出厂到首个 token 的时间,也是世界上最可靠的 AI 基础设施供应链如何学习得比增长更快。

开始使用 为你的代理工作流定制高效、开放权重的模型。

通过订阅 NVIDIA 新闻并在 LinkedIn、X、YouTube 以及 Discord 上的 Nemotron 频道关注 NVIDIA AI,了解 NVIDIA Nemotron 的最新动态。

在 Hugging Face 上访问开放的 Nemotron 模型,并在 build.nvidia.com 上获取 NIM 微服务和开发者示例合集。