精选

NVIDIA Nemotron 3.5 Lightning 为长期运行的智能体提供快速、准确的专业任务执行

长期运行的 AI 智能体将大部分时间用于大量执行:工具调用、结果验证和子智能体委托。在每个执行步骤中使用前沿推理模型会增加成本和延迟。

NVIDIA Nemotron 3.5 Lightning 是一个开放的 300B 混合专家 (MoE) 模型,具有 30B 活跃参数,专为始终开启的智能体执行层构建。它专为 OpenClawHermes Agent 等工具而设计,这些工具均由 NVIDIA NemoClaw 开源安全和管理堆栈提供支持,用于运行始终在线的 AI 智能体。

NVIDIA Nemotron 开放模型系列就像一个软件库,每个版本都在不断提高准确性和速度。随着这些模型的发展,模型路由和编排也在快速成熟。

这一点很重要,因为开发者越来越多地使用模型系统构建应用程序。前沿推理模型 (例如 Nemotron 3 Ultra) 处理编排和复杂规划,而更小、更高效的模型处理大量执行层。

本文将介绍 NVIDIA Nemotron 3.5 Lightning,并解释其较小的 MoE 设计如何针对自主智能体中的大批量、低延迟执行进行优化。它还详细介绍了为其提供支持的推理和训练创新。最后,这篇博文还介绍了 NVIDIA NeMo Switchyard 库,该库可将每项任务智能地路由到适合该工作的最佳模型。

为什么 Nemotron 3.5 Lightning 是长期运行 AI 智能体的理想选择? 

Nemotron 3.5 Lightning 是一个可定制的开放 30B MoE 模型,具有 3B 活跃参数,可为自主智能体提供最佳的大批量执行。MoE 快速高效,因为路由器只将每个 token 发送给其中几个专家,因此每个 token 只运行模型参数的一小部分。这提供了更大的稠密模型的能力,而计算成本较小。

Nemotron 3.5 Lightning 是 Nemotron 3 模型系列中最小的成员,并且搭载了许多经过整个系列验证的相同技术,包括:

  • 预测解码多令牌预测在 Nemotron 3.5 Lightning 训练期间包含 (与 Nemotron 3 Super 和 Nemotron 3 Ultra 一样) 。Nemotron 3.5 Lightning 还附带 DFlash 和 DSpark,可在一系列服务场景中实现更全面的推理优化
  • 线束优化训练:该模型针对热门智能体的线束进行训练,使智能体能够进行更准确的通话,同时降低大量任务的延迟。

最终,我们打造了一个专为执行而构建的模型,该模型可用于从 NVIDIA DGX Spark 到数据中心的各种部署场景,同时还能提高通话量和降低延迟。

视频 1. 了解如何在 DGX Spark 上部署 NVIDIA Nemotron 3.5 Lightning,并将其用于快速、大批量的代理式工作负载

自定义开箱即用的 Nemotron 3.5 Lightning 

当模型适应工作时,就能在专用的 AI 智能体系统中占据一席之地。Lightning 级模型具有高度可定制性:小型模型的微调速度更快、成本更低,且所使用的硬件远超大型模型。

您可以根据工作负载定制开箱即用的 Nemotron 3.5 Lightning。与每次启动 Nemotron 开放模型时一样,我们会在 OpenMDW-1.1 下尽可能宽松地发布权重、训练数据和方法,因此您可以:

此版本包括 Nemotron-RL Agentic Terminal Pivot,这是一个开放的代理强化学习数据集,用于训练一些编码智能体功能。

使用 NeMo Switchyard 将工作分配到正确的模型

虽然前沿模型可能会赢得新闻头条,但像 Nemotron 3.5 Lightning 这样的模型会在战中赢得奖牌。它们处理 git pull 等请求,验证工具输出,格式化结果,并运行控制任何长期运行的智能体令牌预算的常规调用。

模型路由和编排有助于使这种劳动分工更容易实现。它们现已通过 NVIDIA NeMo Switchyard 提供。Switchyard 可以将 Nemotron 3.5 Lightning 与您的开放和封闭模型一起作为路由目标,因此每个请求都会在最强大、最高效的模型上处理。制定前沿计划,执行前沿计划,确保高效使用您的 token。

Nemotron 3.5 Lightning 在速度超快的 Pareto 前沿上的表现如何? 

Nemotron 3.5 Lightning 以同类产品中的最高输出速度提供领先的准确性,并在人工智能分析智能指数中赢得了准确性与速度的对比。该指数结合了九项评估,用于衡量模型在代理式任务、编码、科学推理和通用智能方面的性能。

Nemotron 3.5 Lightning 将强大的智能与类似规模模型高达 4 倍的输出速度相结合,使其处于准确性超快的 Parito 前沿,适用于大量智能体工作负载。

智能体效率最终取决于模型完成有用工作的速度,而不仅仅是生成 token 的速度。在 PinchBench 上,Nemotron 3.5 Lightning 的准确率达到 86%,在类似的精度下,完成 10000 个任务的速度比 Qwen3.6 35B 快 30%。

更高的推理吞吐量和token效率将Nemotron 3.5 Lightning置于效率前沿,帮助始终在线的智能体以更快的速度完成大量工作。

Nemotron 3.5 Lightning 如何在不影响准确性的情况下提供速度?

Nemotron 3.5 Lightning 通过预测性解码和量化,在不影响准确性的情况下提供速度和自定义功能。

预测解码

Nemotron 3.5 Lightning 旨在快速生成 token,并且能够通过预测性解码生成多个 token。在这个过程中,模型或草图模型将起草一些经过高效审查的令牌。Nemotron 3.5 Lightning 进行了专门的预训练阶段,将多令牌预测 (MTP) 嵌入模型,就像 Nemotron 3 Super 和 Ultra 一样。训练后,专用的 MTP 提升阶段进一步提高了 MTP 的准确性。

除了 MTP 之外,Nemotron 3.5 Lightning:DSpark 还提供两个草稿模型,推荐用于 DGX Spark 推理工作负载和低并发数据中心工作负载。MTP 最适合中度到高度并发,其最佳草稿长度会随着并发次数的增加而减少。NVIDIA 还发布了一个 DFlash 草稿模型,该模型可以与其他模型进行比较,可能会更适合您的工作负载。

量化

Nemotron 3.5 Lightning 与 NVFP4 检查点一起附带,使用相同的专用 NVFP4 内核,在 NVIDIA Blackwell、NVIDIA Hopper 和 NVIDIA Ampere GPU 上为 Nemotron 3 Ultra 提供动力支持。与在桌面 DGX Spark 上运行时一样,相同的文件也可在数据中心运行。

Nemotron 3.5 Lightning 如何成为本地 AI 的理想选择?

Nemotron 3.5 Lightning 可在本地系统 (包括 NVIDIA Jetson、GeForce RTX 5090 D 和 DGX Spark) 上使用强大的代理式 AI。

NVIDIA 已与包括 EXO 实验室在内的多个团队合作,以了解此模型在 DGX Spark 上的表现。

此外,您还可以在 LM Studio、llama.cpp、Ollama 和 Unsloth 等行业标准工具集中运行 Nemotron 3.5 Lightning。

合作伙伴生态系统

Nemotron 3.5 Lightning 得到了越来越多的合作伙伴生态系统的支持,涵盖工具、定制、部署和推理,包括:

开始使用 Nemotron 3.5 Lightning 构建

Nemotron 3.5 Lightning 完全开放,包含权重、数据和配方,因此您可以根据工作流程进行调整,并将其部署到任何地方。要开始使用,请在 NVIDIA 官网OpenRouter 上试用。从 Hugging FaceModelScope 中下载权重。想要深入了解?

通过订阅NVIDIA 新闻并在LinkedInXDiscordYouTube上关注 NVIDIA AI,及时了解 NVIDIA Nemotron 的最新动态。

访问Nemotron 开发者页面,获取入门资源。在build.nvidia.com上探索有关Hugging FaceModelScopeBlueprints的开放 Nemotron 模型和数据集。

Nemotron直播、

标签