智能体/生成式 AI

从晶圆到第一个 Token:使用 Nemotron 和 Palantir Foundry 编写供应链专业知识

NVIDIA 拥有世界上最大、最复杂的供应链之一,其性能从晶圆到第一个 token 来衡量。间隔分为两部分。从芯片到机架的运行时间 ( Time-to-rack run) ,再从晶圆厂到到达数据中心层的组装系统。token 生成时间涵盖了此后的所有内容:电力、冷却、网络和软件堆栈,这些堆栈可在基础设施投入使用的第一天就提高工作效率。

NVIDIA Grace Blackwell NVL72 平台在全球拥有数百万个零件和数千家供应商,最终系统由数十家 OEM 和 ODM 构建。一个计算托盘、一个 18 个在一个机架中只需要两个 NVIDIA Grace CPU、四个 NVIDIA Blackwell GPU 和 32 个 HBM3e 堆栈。我们为 Vera Rubin 创建的供应链规模是 Grace Blackwell 的两倍。CPUGPU内存都是关键组件,并且每个组件的可用性每周都会发生变化,因此阻碍构建的部分可能会在下周免费提供。每个供应商都有自己的物料清单、供应商和交付周期。乘以机架中的每个子组件,结果开始看起来不像供应链,更像是一个令人生畏的组合问题。

合同制造商只有在每个组件都从以下三个集合中的一个集合中到达后才能开始组装:NVIDIA 直接提供的部件、NVIDIA 在寄售时库存的部件以及供应商提供的部件。理想情况下,所有组件都会同时到达,但如果不及时到达,则所有组件都会提前到达,等待一切到来的时间。NVIDIA 从制造现场接收材料到将材料作为子组件或产品的一部分离开,全程不间断地运行,该指标被称为拥有时间 (TOO) 。

在高度动态可用性的情况下,NVIDIA 必须决定向每个制造站点分配哪些材料以及分配多少材料。这就是所谓的关键材质分配问题,而且每周都会有人手动对其进行重新设计。分配贯穿当前季度,而下一季度则包含已承诺的最近几周,因此每周的新数据主要会改变未来的变化情况。

本文主要关注机架运行时间,压缩需要完成以下四件事:

  • 实时可见性,可随时查明关键运营瓶颈
  • 冗余,单次故障可能会导致生产中断
  • 可靠性,因此上游生产提交保持
  • 编码化的人类专业知识,因此复杂分配决策背后的判断变成了持续的知识,随着时间的推移会不断合成

虽然最初的三项要求提供了必要的操作基准,但最重要的转变是对人类专业知识的整理。

在 Palantir Foundry 建立供应链指挥中心

NVIDIA 供应链运营团队与 Palantir 合作,为材料分配决策的每个输入创建统一的视图。NVIDIA 团队将其称为数字供应链智能指挥中心,该中心会暴露风险、阻碍因素和其他信号,为这些决策提供依据,但这些信号以前可能一直隐藏在不相关的数据源中。

视频 1. 适用于计算供应链的主权 AI

Palantir Foundry 在幕后提供操作环境。Ontology 将材料、制造现场、提交、容量、分配、生产输出和非结构化定性信号连接到一个受控制的数据层。它由对象和链接 (而不是行和表) 组成,形成了操作现实的完整表示。

这种表征使分配规划人员能够模拟和分析许多不同的场景,使他们能够更广泛地访问决策空间,并为 AI 飞轮奠定基础,从而合成新知识并随着时间的推移提高性能。

使用 NVIDIA cuOpt 解决量化问题

在多个制造工厂之间分配材料首先是一个量化问题,而制定过程从决策变量开始:在接下来的一段时间里,每种受限材料有多少会进入哪些工厂以及何时进入?它们周围是决定答案的所有要素。这包括每个能够构建给定 Blackwell 子组件的制造商,以及材料着陆后每个站点可以吸收的吞吐量。它还包括通过链向后映射的每个所需部件的依赖关系图,因此求解器知道计算托盘因其最稀缺的输入而受阻,而非其平均的输入。该绑定约束不是固定的。它会在以下两者之间切换:

  • GPU、CPU 和显存 (一周至下一周)
  • 所有三种供应路线的入站计时
  • 已经向客户做出的承诺,这些承诺决定了任何一个站点的短缺实际成本
  • 将数千个变量和约束条件解析为每周一次的分配。

NVIDIA cuOpt 是一个用于 GPU 加速决策优化的开源库,可解决这一问题。它从本体中提取输入,并将结果写回作为分配决策。分配采用混合整数线性程序,目标是最大限度地减少拥有时间 (TOO) 。cuOpt 返回的不仅仅是分配本身。它还会报告哪些约束条件,因此规划人员可以看到,维持本周数字的是台湾容量,而不是内存供应。

由于求解速度很快,规划人员还可以探索答案的空间。这段时间内存减少 10% 会发生什么情况?如果新的制造工厂上线,该怎么办?规划人员不再向求解器询问答案,而是开始询问需要权衡什么。

数学计算止步于此

量化优化并不能说明问题的全部。NVIDIA 和 Palantir 根据实际情况对历史分配决策进行了回溯测试,结果揭示了 cuOpt 未能捕捉到的人为因素。

规划人员根据求解器无法看到的信息开展工作:本周与合作伙伴交换的电子邮件、关键区域或正在进行的地缘政治事件的恶劣天气预测、上次供应商情况汇报电话会议的文字记录以及多年积累的专业知识。这些输入为未来时期如何分配材质提供了直觉,正是这种直觉让人类专家比数学专家更胜一筹。

考虑到这一点,NVIDIA 和 Palantir 围绕这些人类专家构建了这一工作流。它记录了分配决策、背后的理由、预期结果和实际结果。机构知识成为明确、可审查的决策逻辑,并且由于这些数据存在于本体中,因此它作为训练 LLM 进行专家判断的基础。

编码决策智能

然后,我们对一个开放权重 LLM 进行了后期训练,以应用相同的推理并提出推荐。在评估 NVIDIA Nemotron 开放模型后,我们选择了 Nemotron 3.5 Lightning,因为它专为智能体工作流的执行层构建。它作为模型系统的一部分执行专门任务,该系统还包括用于编排和常规任务的更大变体。

其混合专家架构有助于高效推理,虽然该模型具有 300 亿个参数,每次向前传递大约 30 亿个活跃参数,但它仍然足够大,足以学习有针对性的策略。这种占用空间使后训练循环变得切实可行,因为较小的模型学习速度更快,并且与较大的模型相比,训练和部署所需的计算量要少得多。

由于 Nemotron 是开放的,因此可以在您自己的计算边界内对其进行后训练。任何组织都可以对自己的运营数据运行相同的飞轮,而无需向外部公开数据。该模型从规划者实际使用的信号中学习:向制造现场提供了多少受限材料、制造商承诺生产什么、最终生产什么以及在做出决策时可用的定性操作证据。

其目标是制定分配策略,以便评估生产风险、推荐分配范围、确定该建议背后的因素,并向供应链团队解释其推理。

同样的记录也会随着评估的利用而翻倍。我们仅使用当天可知的内容回放每个决策,隐藏结果,并将模型的推荐与规划人员的调用和实际发生的情况进行比较。此评估回答的主要问题是:如果此模型上个月一直在运行,是否会进行正确的分配调用?

从本体数据到专业模型

训练过程从 Palantir Ontology 中的操作历史记录开始:

  • 匿名化:NeMo Anonymizer会在训练前删除个人身份信息并混淆敏感领域。
  • 合成数据生成: NeMo Data Designer 可扩展和平衡示例,因此模型不仅可以看到常规的数周数据,还可以看到分配增加、容量限制和中断场景。
  • 监督式微调:NeMo AutoModel训练少量LoRA适配器参数,而基础权重保持冻结,从而减少训练时间、内存需求和检查点大小。
  • 评估:时间点回测通过基础模型和微调模型回放相同的历史决策,隔离训练后添加的内容。

Palantir Autopilot 端到端管理生命周期,从 Ontology 数据启动每个作业,监控已部署的自定义 Nemotron 模型,并保持数据、模型版本和推荐之间的沿袭不变。

部署后,模型会读取当前的操作环境,并返回包含其基本原理和附加风险的建议。规划人员会对其进行审查并进行最后调用。

关闭循环

每个接受、编辑、覆盖和生产结果都会写回 Ontology,并不断累积,直到有足够的代表性数据证明另一次受控制的训练运行是合理的。

未来,反馈将用于强化学习。接受和覆盖的推荐将形成偏好对,奖励包括分配正确性、策略合规性和证据依据。模型永远不会在生产环境中进行自我重新训练。

结果以两种方式复合:规划人员花费更少的时间来重建日常决策,因此决策涵盖更多的站点和产品;分配专业知识也成为机构知识,缩短入职时间,并在整个组织中传播关键知识。

后训练提供的内容

NVIDIA 供应链运营团队与 Palantir 合作,明确模型接收的内容、可能推荐的内容以及这些推荐内容的评分方式。该工作流成为了应用程序和分配决策智能基准。

我们在相同任务和相同评估数据下比较了三个模型:

  • Base Nemotron 3.5 Lightning ( BF16)
  • Nemotron 3 Ultra ( NVFP4)
  • 经过后训练的 Nemotron 3.5 Lightning (BF16)

在开发基准测试中,经过后训练的 Lightning 模型的分配决策准确率达到了 86.7%。Ultra (超高) 达到 55.5%,Lightning (基本) 达到 17.5%。这使后训练模型比 Ultra 高出 31.2 个百分点,比其基础模型高出 69.2 个百分点。

它还会引导对决策类型加权的两个指标,而不是示例。准确度均衡,可平均每类调用次数,因此罕见调用与普通调用数量相当:

58.6%,而 Ultra 为 42.0%。Macro-F1 是每个类别 F1 的平均值,它以精度折叠,因此模型不会因过度预测罕见类别而增加召回率:从 57.5% 提高到 39.5%。这两种情况都很重要,因为供应受限意味着规划人员削减拨款的频率远远高于增加拨款的频率,因此仅凭简单的准确性就能满足多数群体的猜测。

这一课很具体,但很重要:

在有界分配任务中,专用的 300B 模型的表现可能比通用模型大一个数量级以上。

这并不意味着较小的模型整体上更有能力。其收益主要集中在后训练领域。尽管进行了微调,但未来的生产风险预测仍然很困难。专业化改进了决策任务,但未能解决与之相关的所有预测问题。

LoRA 在 2 个 NVIDIA B200 GPU 上运行只需几分钟,足够轻,可以随着反馈的累积而重复。在实践中,这是主权 AI:专有供应链数据、模型权重和推理都保留在单个受治理环境中。这种 AI 堆栈可以部署在本地或云端,使组织能够在其数据、系统和运营需求的地方运行 AI。

学习的供应链

本文中讨论的供应链工作流程并非半导体所独有。任何由经验丰富的人员从碎片化信号中分配关键能力的操作都可以运行相同的飞轮,并根据新的领域进行定制。

这需要完成三项基本任务:

  • 受控制的操作层
  • 包含逻辑推理和结果的决策捕获
  • 可在您自己的安全计算边界内进行后训练的开放模型

操作数据训练模型,模型改进决策,决策成为下一轮受控制训练的新操作数据。这就是 NVIDIA 和 Palantir 如何缩短从晶圆输出到首个 token 的时间,也是全球最可靠的 AI 基础设施供应链学习速度快于增长速度的原因。

开始为您自己的代理式工作流定制高效的开放权重模型。

通过订阅NVIDIA 新闻并在LinkedInXYouTubeDiscord上的Nemotron 频道关注NVIDIA AI,及时了解NVIDIA Nemotron的最新动态。

Hugging Face 上访问开放的 Nemotron 模型,并在 build.nvidia.com 上访问一系列 NIM 微服务和开发者示例。

标签