AI 智能体正在通过合作学习做更多事情。首席智能体可以将复杂的任务分解为较小的作业,并将这些作业分配给专门的子智能体。此外,用户开始同时运行多个智能体会话。用于完成复杂任务的多智能体工作流也变得越来越常见。
这种广度优先的方法可以提高任务完成速度和响应质量,但也会使系统瓶颈化,因为许多请求同时发送到 GPU。
NVIDIA 个人 AI 路由器 (PAIR) 可利用您的本地硬件来缓解这种多智能体和子智能体瓶颈。PAIR 将每个独立的推理请求路由到家庭网络上的可用系统。它与熟悉的本地推理服务 (包括 Ollama 和 LM Studio) 配合使用,因此用户可以扩展智能体可用的计算,而无需重新设计智能体本身。无需更改智能体线束。
NVIDIA PAIR 测试版可通过图形和终端接口用于受支持的 Windows、macOS 和 Linux 系统。它支持兼容 NVIDIA GeForce RTX 20 系列 GPU 及更新版本的系统、NVIDIA RTX PRO 工作站 GPU ( Turing 架构及更新版本) ,以及 NVIDIA DGX Spark 和 Apple M4™ 芯片。

什么是 NVIDIA PAIR?
NVIDIA PAIR 是一款虚拟推理路由器,可更大限度地提高家中的 AI 计算能力。它不是一个新的推理引擎。Ollama 或 LM Studio 仍在选定机器上运行该模型。PAIR 会发现参与的系统,跟踪每个系统是否为请求做好准备,安排独立作业,并将每个响应返回给发起该请求的应用程序。
智能体可以通过它所期望的熟悉的本地界面发送请求。PAIR 通过其代理接收请求,确定其引擎和模型要求,并选择一个符合条件的节点。该节点从头到尾执行请求,并通过 PAIR 将响应发送回来。代理继续看到一个连接,而 PAIR 负责处理其后面的放置。特性包括:
- 没有新的 API:PAIR 代理兼容 Ollama 和 LM Studio 接口,而不是要求每个智能体与新的集群 API 集成。
- 弹性客户端:兼容的系统可以在可用时提供容量,并在需要时丢弃容量,例如关闭系统电源或使系统休眠。
- 本地控制:PAIR 旨在将提示、数据和推理流量保留在用户现有的本地网络上。
PAIR 如何解决多智能体本地推理问题?
以在主要的 NVIDIA RTX AI PC 上运行本地智能体的 AI 专业消费者为例。智能体接收研究、编码或个人组织任务,并将其划分为多个子智能体。每个工作者探索问题的有限部分,而其他工作者则验证证据或汇总结果。
从用户的角度来看,这是一项任务。在推理层,它可以变成数十个独立的模型调用。如果每次调用都针对一个本地引擎,它们就会争夺相同的执行插槽。即使网络上其他位置的 RTX PRO 工作站、笔记本电脑或 DGX Spark 可能具有可用的兼容容量,队列也会增长,主 PC 也会保持占用状态。
PAIR 允许推理层随智能体而扩大。一些子代理请求可以在主 PC 上运行,而另一些则可以在其他配对节点上运行。当工作负载有足够的独立工作时,使用更多的就绪型系统可以减少队列并缩短端到端完成时间。
它可以让主 PC 专注于图形密集型游戏、内容创作或其他交互式工作,同时将推理分配到其他节点。
这是工作负载级并发。PAIR 不会在多个 GPU 上运行一个推理请求。每个请求都分配给一个符合条件的节点,并在其生命周期内一直保留。
利用家庭 AI 集群的弹性
家庭 AI 集群不是微型数据中心。专用集群通常围绕供电、配置一致且持续可用的系统构建。家庭硬件是动态的。游戏 PC 可能会忙于玩游戏。笔记本电脑可能会休眠、关闭或离开网络。一台工作站可能拥有所请求的模型,而另一台机器则没有。可以停止推理引擎,或者用户可以为前景应用程序回收 GPU。
PAIR 围绕这些不断变化的条件而设计。它可以使用 mDNS 发现本地系统,在专用网络上配对支持的设备,并实时查看哪些节点可以接受新工作。客户端节点可以在准备就绪时加入可用池,并在需要时离开,而无需将主页转变为始终开启的专用推理安装。
对于每个新请求,PAIR 都会考虑各种因素,包括:
- 配对节点是否在线
- 是否启用受支持的推理引擎
- 是否存在确切请求的模型
- 当前节点和引擎工作负载,包括活动作业
- 现有 GPU 利用率 (是否有正在运行的图形密集型应用程序或工具)
PAIR 并不取决于每个系统是否相同或永久可用。它可以调度推理请求,并围绕系统在日常生活中的使用方式来管理集群。
演示:Hermes 5 – Subagent 场景
此演示展示了与创建子代理工作负载的 Hermes Desktop 和在每个选定节点上执行模型的 Ollama 的配对。这项任务要求 Hermes 分析一个合成的家庭收件箱,并制定一个值得信赖的“星期日重置 ( Sunday Reset) ”套餐 (必须在今晚、本周、之后或根本不发生) ,并为每个重要结论提供证据。
在五子智能体运行中,Hermes 创建了五名专家来审查证据的独立部分、调和冲突并返回综合计划。Hermes 拥有分解、委托和合成功能。PAIR 拥有推理路由。Ollama 在 PAIR 选择的节点上执行每个请求。
如果在一台 NVIDIA RTX Spark 笔记本电脑上使用 Qwen 3.6 35B A3B,同样的 5 个子智能体工作负载平均需要 18 分钟才能完成。相比之下,包含 NVIDIA RTX Spark 笔记本电脑、DGX Spark 和 RTX 5090 D 的三台设备 PAIR 集群平均只需 8 分钟 48 秒即可完成。请注意,这是一个针对特定配置的非官方演示,不是通用基准测试,也不是线性扩展的承诺。
针对特定配置的非官方演示。结果取决于工作负载并行性、模型、引擎设置、硬件、网络和节点可用性。这不是通用基准测试。
PAIR 中的作业视图是推理运行位置的基本事实。由于一个智能体可以生成多个模型请求,因此 Hermes 智能体数量和 PAIR 作业数量是不同的测量值。只有当 PAIR 遥测数据显示作业在多个符合条件的节点上运行时,才应声明多节点执行。
NVIDIA PAIR 的工作原理是什么?
本节将逐步详细说明 NVIDIA PAIR 的工作原理。
使用本地网络发现查找附近的系统
在每个兼容的 Windows、macOS 或 Linux 系统上安装 PAIR 后,它会使用本地网络发现 (mDNS) 自动查找附近的系统。必要时,还可以通过 IP 地址添加节点。用户批准安全配对请求,以创建 PAIR 可以考虑的可信本地节点集。
在安全连接和配对建立之前,所有节点到节点的通信都会被阻止。建立连接后,使用 MTLS 和生成的证书保护通信安全,以便节点之间的通信在网络上保持私密性。
准备推理引擎和模型
每个参与的节点都运行一个受支持的本地推理引擎:Ollama 或 LM Studio。PAIR 可以帮助安装引擎,并在配对系统上启动模型下载,从而减少准备多台机器所需的工作量。只有当所需引擎已启用且所请求的确切模型可用时,节点才有资格接收请求。
但是,集群中每个节点上的模型不必完全相同。不同的系统可以托管不同的模型,PAIR 可以根据模型位置进行路线规划。在更多节点上加载相同的模型标签只会为调度程序提供更大的符合条件的节点池,以满足该请求的需求。
代理兼容的本地接口
兼容的应用程序通过 PAIR 代理的本地端点发送兼容 Ollama 或兼容 LM Studio 的请求。智能体线束可以继续使用他们已经理解的界面,而不是独立发现每台机器并与之集成。公开可配置基础 URL 的应用可以继续指向其 Ollama 或 LM Studio 各自的端点。
PAIR 通过接管 Ollama 和 LM Studio 用于其服务的默认端口来代理请求。如果代理线束使用不同的端口,则可以在 PAIR 引擎设置中配置代理端口。
PAIR 会检查请求的引擎和模型要求,然后将这些要求传递给路由器。这种分离是设计的核心:智能体决定要请求的工作,而 PAIR 决定符合条件的工作应在何处运行。
调度一个符合条件的节点
调度程序使用有关就绪情况、受支持的引擎状态、请求的模型是否存在和工作负载的当前信息来过滤配对系统。它会选择一个符合条件的节点,然后该系统上的 PAIR 路由器将请求传递给本地推理引擎。来自其他子代理的独立调用可以同时分配给其他就绪节点。
返回响应并使路由可见
选定的引擎执行请求,PAIR 通过同一本地接口将响应流式传输回原始应用。作业和指标视图显示哪个节点处理了每个路由请求,从而使放置可见。
哪些工作负载从 PAIR 中受益最大?
PAIR 最适用于同时公开多个独立请求的工作负载,包括多代理应用和并发本地 AI 工具。
对于这些工作负载,PAIR 可以:
- 在本地网络上的就绪系统中路由独立作业
- 当多个请求需要在一个本地引擎后等待时,减少队列
- 缩短兼容配置中适当并行工作负载的完成时间
- 帮助释放主力 PC 的游戏、创作或其他交互式任务
- 熟悉应用程序工作流程并确保本地优先
PAIR 不会:
- 将 GPU 或显存合并到一个更大的加速器中
- 在机器之间对单个模型进行分片处理或拆分一个推理请求
高度连续的任务、由一次长模型调用主导的工作负载,或者只有一个节点拥有所请求模型的配置,可能会带来较少的好处。使用端到端完成时间、排队、输出质量和在实际使用的系统上观察到的路由来测量重要的工作负载。
开始使用 NVIDIA PAIR
PAIR 为家中的动态 NVIDIA 系统带来集群式体验,同时让用户熟悉本地推理工作流程。请按照以下步骤开始操作:
- 下载适用于受支持的 Windows、macOS 或 Linux 系统的 NVIDIA PAIR 测试版。
- 在 NVIDIA RTX PC、NVIDIA RTX PRO 工作站或 NVIDIA DGX Spark 系统上安装 PAIR。
- 在本地网络上探索并安全地配对系统。
- 启用 Ollama 或 LM Studio,然后下载所需模型或将其放置在符合条件的节点上。
- 在安装了 PAIR 且使用 Ollama 或 LM Studio 的系统上运行兼容代理。
NVIDIA PAIR 项目是开源的。开发者可以检查代码、报告问题,并改进发现、配对、路由、引擎集成、模型、端点和用户体验。