构建 AI 智能体 并非以选择单个模型为终点。每个模型都有自己的长处、短处和成本曲线,这可能会从一种工作负载转移到另一种工作负载,甚至在相同的工作负载中。例如,代理式任务可能需要对一个步骤进行分类,对下一步进行推理,并为常规后续任务创建一个较小的模型。将每个请求发送到最大的模型会增加成本和延迟,而将每个请求发送到较小的模型会降低复杂任务的质量。
模型路由通过编排专业模型和前沿模型来解决这一挑战,以便每个任务使用最适合每个任务的模型。NVIDIA NeMo Switchyard 使这种复杂的工程问题能够实际应用于智能体工作负载,因此开发者可以跨模型规划工作路线,而无需围绕每个提供商或模型选择重建应用。
在运行时,路由器会评估每个请求及其可用的上下文,然后将工作发送到最适合任务要求、约束和策略的模型。根据工作负载,与针对每个请求使用功能更强的模型相比,此模型系统可以提高准确性并降低成本。
NeMo Switchyard 提供了一个用于应用多种路由方法的库。本文将探讨 NeMo Switchyard 如何帮助开发者应用模型系统方法,并构建更高效、更可控的智能体,使其更适合真实的 AI 工作流。
模型路由器如何做出决策
以执行计算机使用任务的模型系统为例,该系统通过终端工作台硬基准测试进行测量 (图 1) 。虽然在本示例中 DeepSeek V4 的整体准确性最高,但并不是每个任务组的最佳模型。例如,Kimi K2.6 更适合 ML 和 RL 工作组,而 Qwen3.5 397B A17B 更适合数学和科学工作组。其余六个工作组应使用 DeepSeek V4。这种方法也可以应用于单个任务级别或完成单个任务的各个阶段。

成本和完成时间使决策变得更加复杂,如图 2 所示。每个模型都有自己的与运行或访问模型相关的成本,以及自己的详细程度配置文件,不仅与令牌相关,还与工具调用相关。

构建路由器需要考虑来自各种来源的信号。每个路由算法都有助于确定从何处获取这些信号。
总体而言,有效的路由决策依赖于以下三个方面的信号:
- 模型功能:哪些模型可以正确地完成任务。
- 模型成本概况:与每个模型相关的延迟和成本。
- 基础架构:系统级信号,可实现可靠、无缝的传递。
要了解功能和成本信号:
- 查看请求本身。路由器可以使用分类根据主题或估计的难度来匹配请求。例如,分类器可以识别查询的主题,将其与模型池中的模型相匹配,并适当地对查询进行路由。嵌入模型或特征制作工具可用于从查询中提取特征。
- 看看模型状态。路由器可以检查模型 logprob、级联、评估代理追踪、模型的残差流、注意力矩阵、影响力等。
- 看看系统。 定价、延迟、负载和智能体特定信号 (包括错误) 是可选项。这些信号可用于评估模型路由器或作为实时路由信号。
重要的是,路由器不仅要考虑使用哪些信号,还要考虑何时以及在何处评估这些信号。例如,对于多轮智能体任务,路由器可以在每个步骤中将每个完整请求路由到特定模型或路由。整个系统可能共享一个池,或者子代理可能会使用专门的模型池来执行任务。
这些问题的答案取决于多个因素,包括用例、部署复杂性、容错性、延迟或吞吐量限制。系统还需要基础设施,以便向智能体/ 用户无缝、无形地传递信息。
NeMo Switchyard 通过支持多个路由器的智能编排层解决了这些挑战。开发者还可以将自己的路由算法或自定义数据引入 NeMo Switchyard。
NeMo Switchyard 如何实现路由
路由算法会生成信号,为具有不同优势的模型的路由决策提供信息依据。系统还需要基础设施来获取路由器的答案,将请求发送到所选模型,然后将响应传输回应用程序。
首先是 NeMo switchyard-libsy,这是 NeMo Switchyard 背后与提供商无关的 SDK。它表示请求,定义系统可用的模型,并管理对所选模型的调用。每个模型目标都有一个语义名称,而其背后的客户端将该名称映射到提供程序端点和模型 ID。这种分离使路由逻辑独立于特定的提供程序。

NeMo Switchyard 可以在策略需要时在智能体的会话中传输路由状态。它还可以保留先前回合的信息 (例如工具结果或相关性决策) ,并将该上下文用于后续的路线决策。当不需要历史记录时,路线可以保持无状态。
这种分离很重要,因为模型部署会发生变化。团队可以更新模型,将其移动到另一个端点,或使用其他提供程序,而无需更改路由集成。NeMo Switchyard 可以通过目标客户端进行模型调用,也可以将调用返回至主机应用。这使得智能体能够在保留相同路由合同的同时,运行时、推理平台或网关控制请求的服务方式。
NeMo Switchyard 服务器是一个参考,用于通过通用 API 提供路由,以模拟 LLM 网关。它接受 OpenAI、Anthropic 和 Responses API 请求,将它们转换为内部 NeMo Switchyard 请求格式,并返回预期的响应格式。它还会记录所选模型、决策依据、token 使用率、延迟和调用结果,以便团队可以检查正在运行的路线。
NeMo Switchyard 中的路由算法
基础设施部署就绪后,下一步是研究使用其做出决策的路由方法。NeMo Switchyard 提供免调优和可调优路由器。
免调优路由器
NeMo Switchyard 包含多个无需调整的路由器,这些路由器无需使用特定工作负载数据进行训练即可做出决策,包括 LLM 分类器、场景路由器和升级路由器。
LLM 分类器
LLM 分类器使用 LLM 作为判断工具,来选择一个候选 LLM,并在之后的回合中保持与该模型的会话相关性。这可以避免重复重新分类在智能体完成任务的过程中未发生重大变化的工作。
这种方法适合无外设和特定领域的系统。团队可以将编码、数学或医疗健康工作任务路由到选定的模型目标,而 NeMo Switchyard 则提供路由和状态管理组件。
阶段路由器
编码智能体会经历不同的阶段。在早期,它会探索代码库,并从错误中恢复。后来,它开始采用更机械的实现。这些阶段需要不同级别的模型能力,而阶段路由器则使用这些能力来做出路由决策。
对于每个回合,场景路由器会检查最近的工具活动,以确定智能体需要多少模型能力。严重错误、重复的非生产性工作或长时间的探索都会促使我们转向具备相应能力的模型。稳定的编写和编辑 (尤其是在测试通过后) 有利于高效模型。如果信号不确定,路由器可以先咨询 LLM 的判断,然后再回退到其配置的默认设置。
升级路由器
升级路由以低成本模型启动每次对话。LLM 评委会依次监控任务的进度,并在检测到持续困难时将会话移至能力更强的模型。
这种方法专为多轮智能体工作负载而设计,其中较小的模型可以处理日常工作,但在重复错误、循环或漂移后可能需要支持,从而将 LLM 分类器路由方法从静态扩展到自适应。

可调整路由器
通过将固定的启发式算法替换为从真实工作负载数据中学习的信号,可调整路由器建立在此路由基础之上。与根据请求文本确定哪个模型最合适不同,可调整路由器可以学习预测每个候选模型正确回答请求的可能性。
预填充路由器
在训练期间,预填充路由器会提取 LLM 的残差流,以估算查询的复杂性。共享主干 MLP 使用来自残差流的信号,并将其映射到路由池中每个 LLM 的精度标签。
在推理时,预填充状态充当路由器的 输入,共享主干预测每个 LLM 成功完成任务或回答查询的可能性。
然后,路由器可以应用一种策略,将预测准确性与成本、延迟或其他部署限制相结合。每个候选模型都会收到一个分数,然后将请求路由到模型,并针对该工作负载做出最佳权衡。图 5 显示,路由不仅仅是选择最强的模型。它是指以合适的成本选择最有可能满足所需质量水平的模型。

使用 NeMo Switchyard 提高智能体效率
NVIDIA 正在与智能体、模型和企业应用生态系统中的合作伙伴合作,无需单独设置,即可将 NeMo Switchyard 模型路由引入现有的开发者工作流。这些合作包括:
- 智能体工作流: 使用 Cognition 的编码智能体工作流、使用 Nous Research 的易于配置的 Hermes Agent 模型路由、使用 Ramp 的金融软件工程工作流,以及使用 LangChain。
- 应用和基础设施集成: LLM 应用堆栈作为 LiteLLM 的插件;AI 网关、治理和 API 流量管理与 孔;Cloude 模型路由与 Classmethod;企业自动化和与 Boomi Agent Garden 的连接。
- 行业特定的 AI 智能体: 在 ChipStack AI Super Agent 和西门子的 EDA 智能体工作流中使用 Cadence 的正式验证工作流。
LangChain 使用其内部深度智能体评估套件对 NVIDIA Nemotron 3.5 Lightning 和使用升级路由器的克劳德・Opus 4.8 之间的五次路由请求运行中,与仅适用于前沿的基准相比,成本降低了 74%。在 5 次运行中,向前沿模型发送的调用仅占 7%,且测量的准确度约为 6 点。该套件包括 145 项反映生产工作负载的多轮代理式任务,例如策略约束下的客户支持对话、呼叫事件调查,以及跨消息传递、问题跟踪和电子邮件的多步骤工作流自动化。该套件可评估工具使用情况、多步骤检索、文件系统操作和长上下文摘要,并使用来自** 工作台航空公司、Berkeley Function Calling Leaderboard、FRAMES 和 Nexus 的场景。
Cognition 在 Devin Desktop 中实施了 NeMo Switchyard 分阶段路由方法,并将其部署到 NVIDIA 内部用户进行实际测试。在 FrontierCode Main ( Cognition 的生产级编码任务基准测试) 上,实现在 Opus 5 和 Kimi K2.7 之间进行。它提供了接近前沿的性能,以 3.11 美元的平均成本实现了 50.6% 的性能 – 与 Opus 5 的准确率相比,在 2.8 个百分点内,平均成本约降低了 28%。该基准测试和内部部署共同提供了模型中立和自适应智能体的实际案例研究,展示了如何随着任务的发展动态应用不同模型的互补优势。
开发者可以从合作伙伴集成开始,将 NeMo Switchyard 引入熟悉的智能体工具、框架和网关,或者使用 NeMo Switchyard GitHub 说明将自定义路由构建到自己的智能体和 LLM 网关中。
编排将持续存在
模型路由使专业模型和前沿模型的系统能够协同工作,提供大于各部分之和的结果。然而,构建实用的生产就绪型路由系统仍然是一项非常艰巨的工程挑战。
NeMo Switchyard 是完全开源的,并集成了您已使用的技术。在 GitHub 上开始使用 NeMo Switchyard,您可以在其中创建、测试和贡献针对您的特定用例定制的路由算法。
随着 AI 系统越来越多地结合模型,路由对于为每个任务选择合适的模型,同时平衡效率、质量和成本至关重要。
通过订阅NVIDIA 新闻并在LinkedIn、X、Discord和YouTube上关注NVIDIA AI,随时了解NVIDIA AI的最新动态。访问开发者页面,获取入门资源。在Hugging Face和Blueprints上探索开放的Nemotron模型和数据集。您还可以在NVIDIA论坛和Discord上与Nemotron直播、教程和开发者社区互动。