智能体/生成式 AI

NVIDIA Nemotron 3 Ultra 在代理式 RTL 编码的准确性和效率方面引领开放模型

现代芯片设计日益受到工程时间的限制。寄存器传输级 (RTL) 开发和验证需要具备专门的硬件知识、精确的推理能力以及与电子设计自动化 (EDA) 工具的重复交互。LLM 加速了代码生成,而 AI 智能体通过使用验证反馈来迭代纠正错误,从而扩展其影响。

这对于 RTL 至关重要,因为 RTL 的正确性取决于精确的时间行为,并且许多错误仅在基于工具的验证期间才会出现。

在本文中,我们将讨论代理式上下文进化 (ACE) -RTL 智能体和 NVIDIA Nemotron 3 Ultra 如何协同工作,在处理代理式 RTL 任务时提供出色的准确性和效率。ACE-RTL 提供迭代的生成 – 测试 – 反射工作流,而 Nemotron 3 Ultra 则提供与 RTL 生成、编辑和调试保持一致的长上下文推理和训练。

CVDP 基准测试

全面的 Verilog 设计问题 (CVDP) 基准测试针对现实 RTL 生成、修改、调试和验证任务评估 LLM。与围绕简短、独立的 Verilog 提示构建的早期基准测试不同,它更好地反映了实际的硬件设计问题。

CID 类别
cid002 RTL 代码完成
cid003 RTL 自然语言规范到代码
cid004 RTL 代码修改
cid005 RTL 规格到 RTL 的模组重用
cid007 RTL 代码改进 ( Linting/ QoR)
cid012 测试台刺激生成
cid013 测试台检查器生成
cid014 断言生成
cid016 调试/ 问题修复
表 1. CVDP 代码生成类别

为什么 RTL 编码需要代理式工作流

RTL 编码不仅仅是“根据提示编写 Verilog”。实用助手必须阅读规范、理解现有模块、重复使用和修改代码、解释仿真失败、调试不匹配,并提出有针对性的修复建议。这些都是原生的代理式工作流。工程师很少在一次尝试中解决复杂的 RTL 任务;他们会使用编译器、模拟器、Lint 工具、波形检测和验证反馈进行迭代。

深入了解 ACE-RTL 智能体

为了在逼真的代理式 RTL 工作流中评估 Nemotron 3 Ultra,我们使用了《ACE-RTL:当代理上下文进化遇到 RTL-Specialized LLM》论文中的 ACE-RTL 智能体。ACE-RTL 代表 RTL 编码智能体的标准模式:生成 RTL、运行模拟或基于工具的检查、分析故障,并以迭代方式优化设计。智能体由三个协同组件组成:生成器、反射器和协调器。生成器生成或更新 RTL 代码。

该反射器可分析仿真反馈,识别可能的根本原因,并提供高级修复指导。协调器在迭代中维护不断演变的调试环境,并决定哪些历史记录和反馈应指导下一代尝试。这允许智能体基于之前的失败而构建,而不是重复地犯类似的错误。

如图 2 所示,ACE-RTL 智能体可显著提高所有评估模型的合格率。GLM 5.2 从独立模型的 44.0% 提高到使用 ACE-RTL 时的 94.3%,Kimi K2.6 从 68.6% 提高到 97.9%,Nemotron 3 Ultra 从 65.7% 提高到 100.0%。这些结果凸显了迭代工具反馈和上下文演变对于解决现实 RTL 任务的重要性。

在下面的图 3 中,我们比较了相同的 ACE-RTL 工作流,将 GLM 5.2、Kimi K2.6 或 Nemotron 3 Ultra 用作代理循环中唯一的 LLM。保持代理固定不变可以隔离模型本身的效果。在 9 个 CVDP 任务类别中,采用 Nemotron 3 Ultra 的 ACE-RTL 提供了最强的整体性能,平均通过率为 97.1%,而 Kimi K2.6 为 95.2%,GLM 5.2 为 92.1%。它在 RTL 完成、规范到 RTL 生成、RTL 修改、模块重用、Lint 和 QoR 改进、测试台刺激和检查器生成、断言生成和 RTL 调试方面获得了广泛的收益。Nemotron 3 Ultra 在多个类别中的通过率也达到 100%。

重要的是,Nemotron 3 Ultra 能够在大幅降低 token 使用量的情况下实现这一准确性。每次迭代平均使用 6629 个 token,而 GLM 5.2 和 Kimi K2.6 分别为 9156 和 22579。这相当于 token 比 GLM 5.2 大约减少 28%,比 Kimi K2.6 减少 71%,同时仍然达到最高的平均通过率。

更高的准确性和更低的 token 成本相结合,对于代理式编码尤为重要。更高的通过率意味着智能体可解决更多独特的硬件问题,而较低的 token 使用率可减少每个优化步骤的推理开销。在实践中,这意味着可以在相同的计算预算内尝试更多的 RTL 任务,并且工程师可以更快地获得结果。

Nemotron 3 Ultra 专为长期运行的代理式推理而构建

Nemotron 3 Ultra 是一个 550B 总参数、55B 活动参数的混合专家混合 Mamba-Attention 模型,专为长期运行的智能体而设计。它使用 20 万亿个文本 token 进行预训练,并扩展到 100 万个 token 的上下文长度。在同类开放模型中,Nemotron 3 Ultra 在关键代理式基准测试中处于领先地位,尽管占用空间较小,但其性能却优于大型开放模型。

混合式 Mamba-Attention 架构通过减少注意力成本和 KV 缓存占用空间来提高吞吐效率,而 MoE 设计提高了每个活动参数的准确性,与其他开放模型相比,吞吐量提高了 5 倍,成本降低了 30%

对于 RTL 工作流而言,效率至关重要,因为智能体上下文会迅速增长。单个调试迭代可能包括规格、模块代码、生成的 RTL、模拟器输出、断言失败和先前的修复尝试。高效的长上下文推理直接影响此类智能体对真正的工程师是否实用。

在 RTL 编码任务上训练 Nemotron 3 Ultra

Nemotron 3 Ultra 的 RTL 功能受益于 ACE-RTL 论文中提出的合成数据生成 (SDG) 工作流。此工作流的目标是创建高质量的 RTL 训练数据,以反映硬件工程师和 RTL 智能体的实际工作方式:不仅根据规范生成代码,还可以修改现有实现和调试失败的设计。

SDG 工作流从公共资源库中过滤的高质量 RTL 种子设计开始。然后,开放的 LLM 将这些种子转换为指令式训练样本,并由一组上下文中的示例提供指导,这些示例定义了预期的格式、细节水平和硬件特定的任务风格。为生成规范到 RTL,LLM 将自然语言规范与源自种子设计的黄金 RTL 实现相结合。

关键的创新在于任务多样性。除了规范到 RTL 的生成之外,该工作流还创建了 RTL 代码编辑和调试任务,从而更好地匹配智能体工作流中的模型运行方式。在编辑方面,原始种子 RTL 作为黄金实现,而简化版本用作输入。配对规格描述了恢复黄金 RTL 所需的功能扩展或极端案例行为。

对于调试,工作流会在种子设计中注入真实的 RTL 错误,例如不正确的有限状态机转换、握手或计时违反,以及其他常见的硬件设计错误。相应的规范包括诊断信息,例如观察到的故障行为或信号不匹配,因此模型可以同时使用代码上下文和反馈来学习修复有故障的 RTL。

所有生成的样本都经过数据过滤器处理,然后用于训练。这包括语法检查、基准测试去污和基于类别的数据评分,使用 LLM-as-judge 来评估规范和 RTL 的实现是否在语义上保持一致。此过滤步骤有助于确保最终合成数据在结构上有效,并且对训练有用。

这种区分对于代理式 RTL 工作流至关重要。在迭代优化期间,模型必须对之前的代码、失败的测试和工具反馈进行推理,而不仅仅是根据清晰的规范生成 RTL。通过对代码编辑和调试任务进行训练,Nemotron 3 Ultra 遇到了与在 RTL 编码代理中解决相同类型的修复和优化问题。

开始使用 Nemotron 3 Ultra 构建

Nemotron 3 Ultra 是一个开放模型,如今可用于工程团队已经依赖的工具中。开发者可以使用它来生成 RTL 并对设计进行迭代,然后将输出结果插入其现有的验证和与合作伙伴的签名流程中,例如:

  • CadenceChipStack AI SuperAgent 与 Nemotron 3 Ultra 的完美结合,通过协调 RTL 生成、测试台创建、回归编排和调试中的专用 AI 智能体,将代理式编排引入前端设计和验证。除了芯片前端,Cadence 还在其 Super Agents 产品系列中启用了 Nemotron 3 Ultra 开放模型:用于数字实施和签名的 InnoStack AI Super Agent、用于定制和模拟的 ViraStack AI Super Agent,以及用于 PCB 和封装全多物理场驱动电子系统设计的 AuraStack AI Super Agent。
  • Siemens:Nemotron 3 Ultra 与 Questa One Agentic Toolkit 搭配使用,可帮助团队更早发现问题、提高工程生产力并更快地交付高质量设计。它还与 Fuse EDA AI 智能体集成,为长期运行的自我验证 EDA AI 智能体提供支持,并将令牌效率提高了 5 倍到 10 倍。
  • 新思科技 AgentEngineer:该技术利用 Nemotron 3 Ultra 模型,通过多智能体系统实现了自主验证关闭,实现了持续、可追踪的反馈循环,显著减少了手动验证工作。其 OpenShell 沙盒可以将数周的手动验证工作缩短到数小时。

深入了解

通过订阅 NVIDIA 新闻 并在 LinkedInXDiscordYouTube 上关注 NVIDIA AI,及时了解 NVIDIA Nemotron 的最新动态。

访问 Nemotron 开发者页面,获取入门资源。访问 NVIDIA 官网,探索 Hugging Face 上的开放 Nemotron 模型和数据集以及 Blueprints on build.nvidia.com

NVIDIA 论坛Discord 上的 Nemotron 频道上与 Nemotron 直播教程和开发者社区互动。

标签