网络安全

NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示了适用于长距自动驾驶智能体的前沿通用架构

该研究项目将 Claude Opus 5 从 30% 的模型基线提升到作为完整 AVO 智能体系统一部分时的 100%,表明系统设计——而不仅仅是模型能力本身——可以释放前沿级的长时程性能

前沿语言模型只是 AI 智能体 的一个组成部分。周围的智能体系统——通常称为线束——决定了模型如何接收上下文、使用工具、维护状态、响应反馈、从故障中恢复,以及在长时间运行的任务中保持进度。挑战在于如何构建智能体架构,使前沿语言模型能够可靠地处理扩展的多步骤任务。

NVIDIA 研究项目代理变异运算符 ( AVO) 解决了构建通用代理架构这一挑战。AVO 最初在棘手的软件工程和 GPU 内核优化任务中得到了演示,成功的关键远不止在单个响应中生成代码。智能体必须检查现有实现、形成假设、做出更改、执行基于硬件的测试、解释反馈,并反复修改其方法。

本文将介绍 AVO 架构和系统级机制,使其能够支持长期运行的自动驾驶工作。我们首先总结其在 GPU 内核优化中的应用,然后描述如何根据 ARC-AGI-3 基准对同一架构进行调整,并展示由此产生的公开集性能、效率和关键经验教训。

AVO 是什么?

AVO 是 NVIDIA 开发的通用编码智能体系统。与现代编码代理一样,AVO 可以检查和编辑代码、运行命令、查阅文档,并在整个执行过程中验证其工作。其重点在于实现长时间的持续自主运行。

在我们的 GPU 内核优化工作中,AVO 将传统进化搜索系统的预定义变异步骤替换为自主代理,该代理决定如何生成下一个候选项,包括检查什么、更改什么、测试什么以及提交什么。对于 ARC-AGI-3,我们将相同的通用代理连接到不同的任务接口。底层智能体保持不变;只有环境专用工具和评估发生变化。

通过自主 GPU 内核优化提高性能

GPU 内核优化为这种架构提供了早期要求严苛的测试。

搜索空间很大,性能格局难以直接推理,微小的实现更改可能会以不执行就难以预测的方式影响正确性、内存行为、调度和吞吐量。

在我们的注意力内核研究中,AVO 连续运行了 7 天,探索了 500 多个优化方向,并生成了 40 个承诺的内核版本。

NVIDIA DGX B200 系统上,在经过评估的配置中,所得的多头注意力内核比 cuDNN 高出 3.5%,比 FlashAttention-4 高出 10.5%。随后,该智能体在大约 30 分钟的额外自主工作中调整了演进的内核,以适应分组查询注意力。

除了最终的内核性能之外,本实验还表明,AVO 可以在多次迭代中维持高效的工程循环,而无需手动指定每个步骤。更广泛地说,AVO 强化了智能体设计的系统级视图:构建可信的智能体堆栈需要在整个系统中设计性能、可靠性和安全性,而不是仅将其视为模型的属性。这一原则也决定了我们如何考虑保护 AI 智能体堆栈。

支持长期运行的代理式工作

AVO 旨在保持超出单个模型上下文的进程。两种机制尤为重要:持久内存和监督。

持久内存会延续先前的实现、评估结果、编译器和分析器输出以及累积推理,允许智能体从当前状态恢复,而不是重复地重建搜索。

主管监控更广泛的停滞或重复的非生产性周期轨迹,并在需要时将主要智能体转向替代策略。在为期 7 天的注意力核函数运行期间,主要智能体仍然负责决定要检查、更改、测试和评估的内容,而主管则在搜索平稳进行时帮助保持进展。

从高性能工程发展为通用推理

NVIDIA 团队最近将相同的底层 AVO 架构应用于一个截然不同的挑战:交互式推理基准测试 ARC-AGI-3,在这种情况下,智能体进入陌生的环境,而没有指令、规定的规则或规定的目标。

AVO 在 ARC-AGI-3 公开设置的所有 25 个环境中获得了 100.00 RHAE 分数,完成了所有 183 个级别。结果说明了一个更广泛的观点:评估模型不同于评估智能体。模型能力非常重要,但周围的系统决定了如何有效地将这种能力转化为持续的自主进程。

GPU-kernel optimization 和 ARC-AGI-3 基准测试在表面上看起来非常不同。

一种是源代码、编译器、分析器和吞吐量。另一种是不熟悉的交互式环境,在这种环境中,智能体必须推理可用操作的效果,发现目标,并高效行动以取得进展。

但基本的计算模式是相似的。在这两种设置中,智能体必须:

  • 根据不完整的证据构建假设
  • 通过外部接口执行操作
  • 观察后果
  • 保持有用状态
  • 修改其问题模型
  • 从错误的假设中恢复
  • 长期持续取得进展

域发生变化。反馈通道发生变化。核心智能体循环则不然。

传递的不是领域知识,而是持续自主发展的机制。

因此,ARC-AGI-3 提供了一个有用的测试,用于判断 AVO 架构是否与软件工程存在根本联系,还是捕获了一些更通用的内容。

在 ARC-AGI-3 上评估 AVO

ARC-AGI-3 是一种交互式推理基准测试。智能体进入陌生的游戏般的环境,没有指令、明确的规则或明确的目标。它必须通过交互来探索,推理环境的动态和目标,并在越来越难的级别上高效地规划行动。

该基准测试使用相对人类动作效率 (RHAE),该指标将任务完成与相对于首次人类基准的每一级动作效率相结合。性能在各个级别和环境中汇总。

这一指标使得 ARC-AGI-3 成为一项要求严苛的长视距智能体任务。成功需要的不仅仅是解决孤立的状态。智能体必须保留有用的知识,从之前的交互中学习,从错误中恢复,并高效地使用环境操作。

我们没有像 Tycho所探索的那样,将 ARC-AGI-3 系统集中在显式编程世界模型构建上,而是采用了VISTA描述的直接交互设计原则,并独立地重新实现了任务界面。这更符合我们将 AVO 评估为通用智能体的目标,而不是引入 ARC 特定的世界模型层。

任务界面的几个元素由 VISTA 提供信息,但智能体后端从根本上不同。VISTA 通过 Claude Code 和 GPT-5.6 Sol 将工具实例化,而我们的系统使用 AVO,NVIDIA 长地平线代理架构,具有持久内存、监督和自己的执行循环。

观察界面也有所不同。VISTA 的主要配置使用渲染的 512 x 512 PNG,同时还探索文本网格表示。在 AVO 配置中,LLM 以纯文本模式运行:每个观察结果均以精确的 64 x 64 文本网格提供,且不会向模型发送任何图像或图像令牌。与直接交互设置一致的是,智能体在没有游戏规则或目标描述的情况下接收到可用的动作,并且必须通过交互来推理其效果。

ARC-AGI-3 基准测试中的 AVO 性能结果

近期的 ARC-AGI-3 系统探索了截然不同的智能体架构,从 Tycho 等显式可执行世界模型到 VISTA 等直接交互工具。这些结果共同表明,基准性能反映了完整的智能体系统,而不仅仅是底层模型。

AVO 使用 Claude 作品 5,以 100.00 的 RHAE 分数完成了完整的 25 个环境公开设置,在 6624 个环境动作中解决了所有 183 个级别。为便于参考,VISTA 在完成相同的 183 个公开设置关卡时,会报告 7542 个环境操作。因此,在此跨系统比较中,AVO 使用的动作大约减少了 12%。

这不应被解释为受控消融:这两个系统在智能体后端、观察表征、内存、上下文管理和其他实现细节方面有所不同。AVO 存储系统是一个架构上的差异,在很长的视野范围内可能很重要,该系统旨在进行有用的理解并减少重复探索,尽管本实验并没有孤立其单独的贡献。

ARC Prize 报告称,Claude Opus 5 在推理能力方面的贡献率约为 30%。我们的运行在不同的推理设置和截然不同的智能体系统和评估设置下使用了相同的模型系列。因此,这些数字不应被解释为对 AVO 性能贡献的直接衡量;相反,它们表明,仅凭模型级别的评估并不能描述完整智能体的性能。

AVO 还专为跨前沿模型运行而设计。虽然我们的完整公开赛制结果使用了Claude Opus 5,但我们还在一系列具有挑战性的游戏中搭配了 AVO 与 GPT-5.6 Sol。在这些有限的实验中,Sol 在某些情况下以更快的速度达到匹配级别,而 Opus 在匹配级别比较中使用的环境操作较少。这些初步结果表明,各模型的操作配置文件互为补充,我们对未来的工作进行了更广泛的系统比较。

这些结果使用官方记分卡和 RHAE 指标覆盖了 25 个环境的 ARC-AGI-3 公共集。它们不是半私有或完全私有竞争集上的结果。

我们从在 ARC-AGI-3 上对 AVO 进行基准测试中学到了什么

最重要的结果不仅仅是 100.00 分,而是同一智能体架构从高度专业化的 GPU 内核优化转移到截然不同的交互式推理任务。

在 GPU 优化中,反馈来自编译器、测试、分析器和性能基准测试。在 ARC-AGI-3 中,反馈来自环境转换和操作结果。接口不同,但循环相同:形成假设、行动、观察证据、更新状态,然后继续。

这表明,通用性不仅可以来自领域知识,还可以来自允许推理和反馈随着时间的推移而不断复合的机制。

更广泛地说,长视距能力是整个系统的特性。内存决定了生存状态,工具决定了可能的行动,反馈决定了进度,而恢复则允许工作在一次模型调用后继续进行。

展望未来

NVIDIA AVO 的研究始于自主软件工程和高性能 GPU 内核优化。ARC-AGI-3 表明,相同的底层架构可以迁移到截然不同的推理环境。

更大的机会是围绕持久性状态、工具使用、地面反馈、恢复和长视野上下文管理构建通用智能体系统,这些系统可以积累证据,并在日益多样化的任务中保持进展。

模型很重要,但模型并非整个智能体。

如需了解详情,请查看以下资源:

编者注:我们更新了措辞,以便更准确地区分 ARC-AGI-3 公共集与半私有和私有竞争集。

标签