网络/通讯

使用数字孪生和 AI 智能体验证 AI 工厂变更

AI 工厂是世界上最复杂的运营之一,将 GPU、CPU、交换机、DPU 和 SuperNIC 与调度程序、编排服务、安全控制和快速变化的软件堆栈相结合。有效部署此基础架构是一项挑战。此外,还能够验证基础架构、软件和策略是否协同工作,以处理业务计划运行的工作负载。为了更大限度地缩短创建首个 token 的时间,AI 工厂操作员不能等到硬件到达后再进行验证。

将 AI 智能体连接到数字孪生

基于节点的数字孪生模拟是 AI 工厂基础设施和操作界面的高保真、可执行表示。与物理副本不同,它为平台团队提供了一个安全、API 可访问的环境,以便在进行生产变更之前对硬件拓扑和软件堆栈进行建模、进行变更、观察行为并验证结果。它集成到 CI/ CD 工作流中,可以在推广前自动验证支持的配置和软件更改。它将仿真从规划活动扩展到持续可用的操作能力。

代理式 AI 使这种能力变得活跃。智能体可以查询生体、运行检查、比较结果、检索相关操作上下文,并启动后续工作流。其结果是找到了一条切实可行的途径,可以将验证时间向左转移,缩短 AI 时间,并提高生产效率,而不会首先对生产进行更改测试。

在硬件到达之前验证配置

AI 工厂是一个系统。其特征通过跨层交互呈现:加速器配置、网络结构、存储、Kubernetes 和调度、GPU 编排、租户隔离、身份和访问控制、可观察性以及 AI 应用本身。单独验证任何一层是不够的。

传统环境通常会迫使团队等待安装物理硬件并安装线缆,组装实验室,启动软件,然后验证系统是否按计划运行。这一过程成本高昂且速度缓慢,尤其是在设计灵活且许多团队同时做出更改的情况下。

基于节点的数字孪生代表受支持的基础设施软件和 API,因此团队可以在硬件可用或生产部署之前针对具有代表性的环境开展工作。团队可以在逻辑生中验证支持的配置和软件更改,然后再通过交付管道进行推广。

其直接效益是显而易见的:

  • 在整个物理系统到达之前验证支持的配置和软件集成。
  • 缩短构建物理实验室、启动软件和验证多租户所需的时间。
  • 在部署物理基础架构或产能之前,先测试具有代表性的大规模设计和工作流程。
  • 在进行生产变更之前,先在生中测试受支持的网络配置和软件集成。
  • 在 Day 0 规划、Day 1 部署和 Day 2 操作中使用相同的模型。

基于节点的仿真作为逻辑数字孪生并不旨在取代所有仿真技术。它将成为更广泛的仿真策略中的高保真集成和验证层。

为每个决策选择模拟

AI 工厂团队需要多种仿真方式。基于节点的仿真支持对支持的配置和软件进行集成测试和操作验证。单独的集群、性能、功率和内存模型可以在其经过验证的范围内进行容量和资源规划。团队应将这些模型输出与其在 DSX Air 中验证的配置和软件行为区分开来。

区分非常重要。性能模型可以预测配置的影响。基于节点的仿真可以显示当目标堆栈、API、策略和编排器一起执行时会发生什么。智能体应能够针对提出的问题使用每种形式的模拟,然后将生成的证据保存在交付和运营工作流中。

构建受治理的智能体验证循环

可以为智能体分配有边界的目标,使用经批准的工具查询或更改数字孪生,评估结果状态,并返回证据支持的推荐或触发受治理的工作流程。

考虑一下典型的闭环:

  • 提议的基础架构或软件变更将进入 CI/ CD 或变更管理工作流。
  • 智能体配置或选择相关的逻辑生,包括拓扑、租户策略、工作负载配置文件和操作限制。
  • 智能体运行工作流程可用的验证工具,例如支持的配置检查、安全和合规性检查以及基础设施运行状况分析。工作负载和性能评估需要适当的模型或测量值;基于视觉的检查需要相关的图像或视频输入。
  • 它将结果与从已批准文档中检索到的组织策略和领域知识进行比较。
  • 它会生成基于证据的报告,然后推荐推广、启动补救任务或将案例提交人工审批。
  • 部署后,相同的模式可以观察生产信号,并不断改进生、验证套件和操作程序。

这是一种受监管的自动化模型,不是向智能体提供无限制的生产访问权限的邀请。仿真平台提供了一个沙盒,智能体可以在其中探索、测试和提出更改建议。人机回圈门和策略控制可确定结果何时会影响生产。

将 DSX Air 仿真与 NVIDIA Brev GPU 计算连接起来

NVIDIA DSX Air 为 AI 工厂提供数字孪生:这是一个仿真环境,团队可以在 AI 工厂设计的整个生命周期中对其进行建模、验证和操作。规模是核心能力:团队可以验证具有代表性的大规模基础设施场景 (包括大型网络结构) ,同时保持运营工作流程所需的软件和 API 保真度。DSX Air 是可重复的基础架构验证的基础,也是代理式工作流的自然操作环境。

NVIDIA Brev 通过向开发者和工作流程提供按需 GPU 资源来完善这一基础。在 DSX Air 环境中,用户可以连接到 Brev,选择 GPU 支持的可启动资源,然后将该资源提供给逻辑生工作流。NGC 中的通用组织上下文有助于简化整个仿真环境和 GPU 服务的体验。

团队可以使用这些功能启动实验或工作流程所需的 AI 服务,将其连接到具有代表性的工厂环境,并让智能体针对该环境执行验证任务。通过将计算支持的 AI 服务引入可扩展的仿真生平台,团队可以从孤立的 AI 演示转向可重复的 AI 工厂工作流。

将视频智能应用于智能体工作流

用于视频搜索和总结 (VSS) 的 NVIDIA AI Blueprint 展示了这种模式可以实现的功能。VSS 环境在 NVIDIA DSX Air 中进行仿真。AI 模型在仿真之外,在通过 NVIDIA Brev 提供的 GPU 实例上运行。VSS 连接到这些模型以分析和搜索视频。这可将工作流大规模引入逻辑生,而非局限于独立服务演示。有关结合 VSS、NVIDIA NemoClaw 和 NVIDIA RAG Blueprint 的实际示例,请参阅将上下文感知的视频 AI 智能体集成到企业工作流中。

在此工作流中,代理式编排层通过检索增强型企业知识来协调视频理解。智能体收集请求参数、调用视频分析、检索相关策略或域上下文、生成引用的报告,并将结果路由到下游系统 (例如 Jira) 。该架构将专业功能 (视频 I/ O、搜索和理解、知识检索、报告生成和企业操作) 分离开来,同时通过智能体驱动的工作流提供这些功能。

图 6 为 VSS 视频智能架构。此处描述的工作流包含四个层:

  • 编排:NVIDIA NemoClaw 智能体、vss-generate-video-report-rag 技能和 HITL 提示。
  • VSS 智能体:视频 I/ O、搜索、理解、LVS、知识检索和报告生成。知识检索是智能体的一部分,而不是单独的扩展。
  • NVIDIA RAG Blueprint:NVIDIA RAG API、Milvus 向量数据库、NVIDIA Nemotron 重排序 NIM,以及索引参考和组织文档。
  • LLM 融合:利用通过 RAG Blueprint 检索的上下文丰富 VSS 提供的摘要。

数据向下流经系统,通过智能体的工具编排对 LVS 服务和 RAG Blueprint 的调用,这两个服务和 RAG Blueprint 都输入到报告生成工具以进行最终输出。

在数字孪生的上下文中,VSS 不仅仅代表视频摘要。视频源、模拟摄像头视图、检查记录或操作记录可以成为验证 AI 工厂的智能体的证据来源。通过在可扩展的仿真环境中运行此工作流,团队可以针对更大、更具代表性的 AI 工厂场景评估相同的智能体模式。例如,智能体可以:

  • 检查与模拟或真实设施工作流程相关的视频,并识别异常情况。
  • 检索与该异常相关的操作程序、安全策略或服务文档。
  • 将发现结果与生配置和基础架构状态关联起来。
  • 生成包含视频证据和来源参考的可追踪报告。
  • 优先创建修复任务或请求人工做出决策。

VSS 展示了一种可重复使用的检测、推理、行动模式。专用 AI 服务可提供高质量信号。检索为企业知识提供了依据。智能体负责协调工作。逻辑生提供了一个安全、高保真的环境,在其成为生产操作之前验证结果。

在整个生命周期中扩展反馈回路

该架构的价值在于反馈回路。团队可以将模拟作为操作系统的一部分,而不是将其视为一次性设计任务:

  • 在硬件可用之前,设计智能体会评估所提议的拓扑和部署方案。
  • 验证代理执行真实的软件接口,并检查提议的更改是否保持租户隔离、安全性和资源限制。
  • 运营智能体总结基础设施证据,识别漂移或异常情况,并根据必要的上下文准备工单或升级。
  • 持续改进智能体使用已部署工作流的结果来优化逻辑生中的场景、策略和测试覆盖率。

适用于企业运营的设计智能体工作流

要从概念验证转向可靠的平台,团队应围绕以下实践原则进行构建:

  • 从有界循环开始。选择一个具有明确输入、决策和操作的工作流,例如部署前策略检查、容量验证运行或从检查到工单流程。
  • 在经过批准的环境中制定决策。将智能体连接到精心策划的操作文档、策略、运行手册和设计约束。在生成的报告中保留引用和证据。
  • 独立于生产机构进行实验。让智能体在逻辑生中执行广泛的实验;对生产变更应用明确的策略、审批和身份控制。
  • 控制循环。跟踪验证范围、决策时间、误报、补救结果以及模拟和观察到的行为之间的差距。
  • 在整个生命周期中使用相同的模型。仅在设计期间有用的生体忽略了其最高价值的作用:支持具有通用操作环境的零日规划、第一天部署和第二天操作。

从一个受支持的验证工作流开始

机会在于将 AI 工厂本身视为经过持续验证的智能系统。首先,在 DSX Air 中对具有代表性的环境切片进行建模,通过 NVIDIA Brev 连接运行选定 AI 工作流所需的 GPU 资源,然后选择一个可以针对生体运行且具有明确成功标准的代理式循环。

VSS 的实施就是一个令人信服的例子:它将视频证据和企业知识转化为协调行动。相同的架构可以支持基础设施运行状况报告、安全与合规性验证、设计验证、性能调查以及整个 AI 工厂生命周期中的其他自主工作流。

当智能体可以安全地与数字孪生对抗时,组织可以从被动操作转向证据驱动,不断改进 AI 工厂,并缩短从基础设施理念到经过验证的生产路径之间的时间。

开始使用 NVIDIA DSX Air,并通过阅读 用户指南 了解更多信息。

标签