长期运行的 AI 智能体将大部分时间用于大量执行:工具调用、结果验证和子智能体委托。在每个执行步骤中使用前沿推理模型会增加成本和延迟。
NVIDIA Nemotron 3.5 Lightning 是一个开放的 300B 混合专家 (MoE) 模型,具有 30B 活跃参数,专为始终开启的智能体执行层构建。它专为 OpenClaw 和 Hermes Agent 等工具而设计,这些工具均由 NVIDIA NemoClaw 开源安全和管理堆栈提供支持,用于运行始终在线的 AI 智能体。
NVIDIA Nemotron 开放模型系列就像一个软件库,每个版本都在不断提高准确性和速度。随着这些模型的发展,模型路由和编排也在快速成熟。
这一点很重要,因为开发者越来越多地使用模型系统构建应用程序。前沿推理模型 (例如 Nemotron 3 Ultra) 处理编排和复杂规划,而更小、更高效的模型处理大量执行层。
本文将介绍 NVIDIA Nemotron 3.5 Lightning,并解释其较小的 MoE 设计如何针对自主智能体中的大批量、低延迟执行进行优化。它还详细介绍了为其提供支持的推理和训练创新。最后,这篇博文还介绍了 NVIDIA NeMo Switchyard 库,该库可将每项任务智能地路由到适合该工作的最佳模型。
为什么 Nemotron 3.5 Lightning 是长期运行 AI 智能体的理想选择?
Nemotron 3.5 Lightning 是一个可定制的开放 30B MoE 模型,具有 3B 活跃参数,可为自主智能体提供最佳的大批量执行。MoE 快速高效,因为路由器只将每个 token 发送给其中几个专家,因此每个 token 只运行模型参数的一小部分。这提供了更大的稠密模型的能力,而计算成本较小。
Nemotron 3.5 Lightning 是 Nemotron 3 模型系列中最小的成员,并且搭载了许多经过整个系列验证的相同技术,包括:
- 预测解码: 多令牌预测在 Nemotron 3.5 Lightning 训练期间包含 (与 Nemotron 3 Super 和 Nemotron 3 Ultra 一样) 。Nemotron 3.5 Lightning 还附带 DFlash 和 DSpark,可在一系列服务场景中实现更全面的推理优化。
- 线束优化训练:该模型针对热门智能体的线束进行训练,使智能体能够进行更准确的通话,同时降低大量任务的延迟。
最终,我们打造了一个专为执行而构建的模型,该模型可用于从 NVIDIA DGX Spark 到数据中心的各种部署场景,同时还能提高通话量和降低延迟。
自定义开箱即用的 Nemotron 3.5 Lightning
当模型适应工作时,就能在专用的 AI 智能体系统中占据一席之地。Lightning 级模型具有高度可定制性:小型模型的微调速度更快、成本更低,且所使用的硬件远超大型模型。
您可以根据工作负载定制开箱即用的 Nemotron 3.5 Lightning。与每次启动 Nemotron 开放模型时一样,我们会在 OpenMDW-1.1 下尽可能宽松地发布权重、训练数据和方法,因此您可以:
- 使用 NeMo Automodel 和 NeMo Megatron Bridge 通过 LoRA 或完整 SFT 进行微调
- 使用 NeMo RL 和 NeMo Gym 运行强化学习和基于环境的评估和部署
此版本包括 Nemotron-RL Agentic Terminal Pivot,这是一个开放的代理强化学习数据集,用于训练一些编码智能体功能。
使用 NeMo Switchyard 将工作分配到正确的模型
虽然前沿模型可能会赢得新闻头条,但像 Nemotron 3.5 Lightning 这样的模型会在战中赢得奖牌。它们处理 git pull 等请求,验证工具输出,格式化结果,并运行控制任何长期运行的智能体令牌预算的常规调用。
模型路由和编排有助于使这种劳动分工更容易实现。它们现已通过 NVIDIA NeMo Switchyard 提供。Switchyard 可以将 Nemotron 3.5 Lightning 与您的开放和封闭模型一起作为路由目标,因此每个请求都会在最强大、最高效的模型上处理。制定前沿计划,执行前沿计划,确保高效使用您的 token。
Nemotron 3.5 Lightning 在速度超快的 Pareto 前沿上的表现如何?
Nemotron 3.5 Lightning 以同类产品中的最高输出速度提供领先的准确性,并在人工智能分析智能指数中赢得了准确性与速度的对比。该指数结合了九项评估,用于衡量模型在代理式任务、编码、科学推理和通用智能方面的性能。
Nemotron 3.5 Lightning 将强大的智能与类似规模模型高达 4 倍的输出速度相结合,使其处于准确性超快的 Parito 前沿,适用于大量智能体工作负载。

智能体效率最终取决于模型完成有用工作的速度,而不仅仅是生成 token 的速度。在 PinchBench 上,Nemotron 3.5 Lightning 的准确率达到 86%,在类似的精度下,完成 10000 个任务的速度比 Qwen3.6 35B 快 30%。
更高的推理吞吐量和token效率将Nemotron 3.5 Lightning置于效率前沿,帮助始终在线的智能体以更快的速度完成大量工作。

Nemotron 3.5 Lightning 如何在不影响准确性的情况下提供速度?
Nemotron 3.5 Lightning 通过预测性解码和量化,在不影响准确性的情况下提供速度和自定义功能。
预测解码
Nemotron 3.5 Lightning 旨在快速生成 token,并且能够通过预测性解码生成多个 token。在这个过程中,模型或草图模型将起草一些经过高效审查的令牌。Nemotron 3.5 Lightning 进行了专门的预训练阶段,将多令牌预测 (MTP) 嵌入模型,就像 Nemotron 3 Super 和 Ultra 一样。训练后,专用的 MTP 提升阶段进一步提高了 MTP 的准确性。
除了 MTP 之外,Nemotron 3.5 Lightning:DSpark 还提供两个草稿模型,推荐用于 DGX Spark 推理工作负载和低并发数据中心工作负载。MTP 最适合中度到高度并发,其最佳草稿长度会随着并发次数的增加而减少。NVIDIA 还发布了一个 DFlash 草稿模型,该模型可以与其他模型进行比较,可能会更适合您的工作负载。
量化
Nemotron 3.5 Lightning 与 NVFP4 检查点一起附带,使用相同的专用 NVFP4 内核,在 NVIDIA Blackwell、NVIDIA Hopper 和 NVIDIA Ampere GPU 上为 Nemotron 3 Ultra 提供动力支持。与在桌面 DGX Spark 上运行时一样,相同的文件也可在数据中心运行。
Nemotron 3.5 Lightning 如何成为本地 AI 的理想选择?
Nemotron 3.5 Lightning 可在本地系统 (包括 NVIDIA Jetson、GeForce RTX 5090 D 和 DGX Spark) 上使用强大的代理式 AI。
NVIDIA 已与包括 EXO 实验室在内的多个团队合作,以了解此模型在 DGX Spark 上的表现。

此外,您还可以在 LM Studio、llama.cpp、Ollama 和 Unsloth 等行业标准工具集中运行 Nemotron 3.5 Lightning。
合作伙伴生态系统
Nemotron 3.5 Lightning 得到了越来越多的合作伙伴生态系统的支持,涵盖工具、定制、部署和推理,包括:
- 后训练:AgileRL、Applied Compute、Deep Cogito、distil labs、Fastino Labs、Locai Labs、Prime Intellect、Reasonable、Thinking Machines Lab、Thinkworks、Trajectory、Uniphore
- 推理软件: Ollama、Exo、Canonical、LM Studio、Unsloth
- 线束和智能体框架: Aible、Cline、Factory AI、Hermes Agent、Kilo Code、LangChain、LM Studio Bionic、OpenClaw、OpenCode、OpenHands、Pi
- 云服务提供商平台: Amazon SageMaker JumpStart、 Google Cloud Gemini Enterprise Agent Platform、MSFT Foundry、OCI Enterprise AI
- GSI: Accenture、Tata Consultancy Services、Tech Mahindra、Wipro
- AI 原生用户: Arcos Labs、CodeRabbit、Dream、Harvey
- 托管推理服务提供商: Baseten、Bitdeer AI、BlackBox AI、CoreWeave、Crusoe、DeepInfra、Fireworks AI、FriendliAI、GMI Cloud、Modal、Nebius、Together AI
开始使用 Nemotron 3.5 Lightning 构建
Nemotron 3.5 Lightning 完全开放,包含权重、数据和配方,因此您可以根据工作流程进行调整,并将其部署到任何地方。要开始使用,请在 NVIDIA 官网 或 OpenRouter 上试用。从 Hugging Face 和 ModelScope 中下载权重。想要深入了解?
- 阅读Nemotron 3.5 Lightning 指南
- 使用 vLLM、SGLang 和 TensorRT-LLM 部署指南进行部署
- 使用Switchyard 文档设置路由
通过订阅NVIDIA 新闻并在LinkedIn、X、Discord和YouTube上关注 NVIDIA AI,及时了解 NVIDIA Nemotron 的最新动态。
访问Nemotron 开发者页面,获取入门资源。在build.nvidia.com上探索有关Hugging Face、ModelScope和Blueprints的开放 Nemotron 模型和数据集。
在Nemotron直播、