计算机视觉/视频分析

将上下文感知型视频 AI 智能体集成到企业工作流中

能够根据大量视频片段进行感知、推理和行动的视频分析 AI 智能体 必须与现有工作流程和应用集成,才能发挥作用。其中包括内容管理系统、市场宣传平台、数据库、工单队列和升级路径。

这种集成具有挑战性,因为视频系统、企业知识库和运营工具通常是孤立的。开发者需要捕获用户意图、检索正确的组织环境、生成结构化报告,并将发现结果传送到下游系统。

在上一篇文章中,我们介绍了如何使用 NVIDIA Blueprints 通过文档知识丰富视频分析。本文将继续介绍该主题,并介绍如何通过引入 NVIDIA NemoClaw,解锁不仅分析视频的能力,而且以编程方式对这些分析采取行动的能力。您将学习如何:

  • 扩展 VSS,实现引导式上下文感知视频分析
  • 使用 NVIDIA NemoClaw 将 VSS 和 RAG 蓝图编排为可组合服务
  • 生成包含丰富的组织和参考知识的结构化报告
  • 构建多步骤工作流,将视频分析输入到其他业务流程中
  • 在企业环境中部署和扩展此解决方案

这种方法是情境感知视频 AI 智能体的下一步,从“这个视频展示了什么?”转向“对于这个视频展示的内容,我们应该做些什么,以及我们如何大规模地协调行动?”

NVIDIA NemoClaw 和 NVIDIA Blueprint 是什么?

NVIDIA NemoClaw 是用于构建自主智能体的开放式蓝图。它使生态系统能够构建特定领域专用且始终在线的智能体,这些智能体更安全、更快速,并且在数字和物理工作流中更具成本效益。

NVIDIA Blueprint 是可定制的参考工作流,用于构建企业级代理式 AI 工作流。它们将专用微服务、优化模型和可组合 API 相结合,在保持模块化的同时加速实现价值。除 NemoClaw 外,本文中还使用了以下主要蓝图:

VSS 如何从视频中捕获意图、检索知识并生成报告?

VSS 通过智能体内置的一组工具提供上下文感知的引导式视频分析。人在环 (HITL) 提示在开始任何处理之前捕捉用户想要的内容。智能体检索相关的组织知识,并生成带时间的结构化报告。 

与用于构建自主智能体的 NVIDIA NemoClaw Blueprint 结合使用时,该系统可以超越简单的视频分析,以编程方式对这些分析采取行动。这解锁了生成工单、跨多个来源比较模式、起草修订程序、上报异常以及将结果输入下游工作流的能力。

三种智能体工具协同工作,共同实现这一目标:

  • 长视频摘要 (LVS) 视频理解工具:使用强制 HITL 参数收集执行长视频摘要。用户以交互方式指定场景 (视频内容) 、感兴趣的事件 (检测内容) 、关注对象 (追踪内容) 和可选的知识检索查询。
  • 知识检索 (Frag) 工具:调用 RAG Blueprint,从文档、策略、参考数据和知识库中检索组织特定的上下文。RAG Blueprint 可在内部处理嵌入、重新排序和向量搜索。
  • 报告生成工具:生成将视频分析与检索到的上下文相结合的结构化报告,并提供时间、叙事分析和引用。它可以使用 HITL 让用户在生成报告之前确认或编辑提示。

这些工具共同通过 HITL 收集用户意图,查询 RAG Blueprint 以获取上下文知识,使用该上下文处理视频,并将报告生成工具交给格式化输出。

为了展示这一过程,我们将创建一个“健康饮食教练”,通过分析食物视频来评估用户的饮食习惯,并返回具体内容,跟踪他们可以采取的后续行动。后续章节将详细介绍该过程。

用户上传视频并指定要分析的内容

首先,用户通过 VSS 界面上传餐前准备视频 (图 1) 。

然后,NemoClaw 开始工作流程。它读取 vss-generate-video-report-rag 技能定义 (SKILL.md) ,了解分析需要哪些参数,并将请求交给 VSS 代理,后者会在用户终端中引导用户完成一系列简短的 HITL 提示 (图 2) 。

提示询问要分析的内容、场景、感兴趣的事件、要跟踪的对象,以及用于检索参考知识的可选 RAG Blueprint 查询,例如营养或监管指南。在处理任何视频之前,捕捉此意图会预先分析用户实际关心的内容。对于自动批量运行,可以通过编程方式 (而非交互方式) 提供这些答案。

NemoClaw 编排 VSS 和 RAG Blueprint

接下来,在确认参数后,NemoClaw 会编排工作流。LVS 视频理解工具首先查询 RAG Blueprint 中的相关营养指南,然后 RAG Blueprint 返回匹配的参考文档,在内部处理向量搜索。 

然后,它将这些参数、视频和检索到的上下文传递给 LVS 服务,该服务以分层方式对视频进行总结,并将参考知识融入到其发现中。该报告生成工具会将结果合并为带时间的结构化报告,其中包括带时间的检测到的事件、基于参考资料的叙事分析、对相关源文件的引用以及具体的推荐行动。 

图 3 显示了 NemoClaw 终端中的编排,包括智能体的推理和工具调用。

NemoClaw 创建 Jira 工单 

NemoClaw 会读取完成的报告,并将其转化为协调行动。它提供已完成的分析 (包含指向 Markdown 和 PDF 报告的链接以及视频回放) 、健康食物的摘要,以及后续步骤建议 (图 4) 。然后,系统会自动创建一个 Jira 工单,汇总结果和建议的饮食调整,并指定适当的优先级和分配,以便跟踪行动项目,直至完成 (图 5) 。

这一下游步骤远不止适用于 Jira。根据报告包含的内容,NemoClaw 还可以:

  • 为发现结果创建工单,并赋予正确的优先级和分配。
  • 升级或总结在多次运行中出现的模式。
  • 捆绑支持证据以进行审查或合规性。
  • 将差距分配到适当的后续工作流程。

此时,报告不再是静态文档。它将触发团队已使用的系统之间的协调行动。

图 6 显示了分为四个层的架构:

  • 编排:NemoClaw 智能体、vss-generate-video-report-rag 技能和 HITL 提示
  • VSS 智能体:工具包括视频 I/ O、搜索、理解、LVS、知识检索和报告生成。知识检索是智能体的一部分,而不是单独的扩展
  • RAG Blueprint:NVIDIA RAG API、Milvus 向量数据库NVIDIA Nemotron 重排序 NIM,以及索引参考和组织文档
  • LLM 融合:使用通过 RAG Blueprint 检索的上下文丰富 VSS 提供的摘要

数据向下流经系统,通过智能体的工具编排对 LVS 服务和 RAG Blueprint 的调用,这两个服务和 RAG Blueprint 都输入到报告生成工具以进行最终输出。

如何通过知识检索部署 VSS 智能体

按照以下步骤为您自己的工作流程实施解决方案。

预备知识

  • 配备至少 24 GB VRAM 的 NVIDIA GPU
  • Docker 引擎和 Docker Compose v2
  • NGC API 密钥 (ngc.nvidia.com)
  • NVIDIA 构建 API 密钥 (build.nvidia.com)
  • 已部署且可从智能体访问的 RAG Blueprint (可访问其服务器 URL) 及其集合名称
  • 已安装 NemoClaw (用于编程访问)

第 1 步:克隆 VSS 存储库并使用 NGC 进行身份验证

git clone https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization.git ~/vss-public
cd ~/vss-public
echo "$NGC_CLI_API_KEY" | docker login nvcr.io --username '$oauthtoken' --password-stdin

第 2 步:配置环境

编辑 LVS 配置文件 .env 文件 deploy/docker/developer-profiles/dev-profile-lvs/.env。除了 RAG_ values 之外,所有变量都存在于该文件中,智能体的 RAG 配置会读取该变量并自行添加。

# Deployment selection
MODE=2d
BP_PROFILE=bp_developer_lvs
HARDWARE_PROFILE=H100         # H100, L40S, RTXPRO4500BW, RTXPRO6000BW, DGX-SPARK, IGX-THOR, AGX-THOR, or OTHER
 
# LLM / VLM placement
LLM_MODE=local_shared         # local_shared runs LLM and VLM on one GPU; use 'local' for separate GPUs
VLM_MODE=local_shared
LLM_DEVICE_ID='0'
VLM_DEVICE_ID='0'
 
# Paths (you MUST set these)
VSS_APPS_DIR="<PATH>/vss-public/deploy/docker"
VSS_DATA_DIR="<PATH>/vss-apps-data"
HOST_IP='<YOUR_IP>'
 
# Agent image + config
VSS_AGENT_VERSION=3.2.0
# Enable knowledge retrieval (frag): point at config_rag.yml (default config.yml has it off)
VSS_AGENT_CONFIG_FILE=./deploy/docker/developer-profiles/dev-profile-lvs/vss-agent/configs/config_rag.yml
 
# Credentials
NGC_CLI_API_KEY='nvapi-...'
NVIDIA_API_KEY='nvapi-...'
 
# RAG Blueprint connection (read by config_rag.yml)
RAG_SERVER_URL='http://<RAG_SERVER>:8081/v1'
RAG_API_KEY='<YOUR_RAG_API_KEY>'
KNOWLEDGE_COLLECTION='<YOUR_COLLECTION>'

VSS_AGENT_CONFIG_FILE 设置为 config_rag.yml 可启用 Frag 知识检索工具。这三个 RAG_ 值是智能体需要的唯一 RAG 设置:它调用 RAG 服务器的搜索端点,RAG Blueprint 在内部处理嵌入、重排序和向量搜索。按照 RAG Blueprint 部署本身的文档配置向量数据库、嵌入和重排序。

第 3 步:部署 VSS 堆栈

创建绑定挂载所需的数据目录,然后启动堆栈。系统会自动从 .env 文件中的 COMPOSE_PROFILES 中选择合成配置文件。

export VSS_DATA_DIR=<PATH>/vss-apps-data
mkdir -p "$VSS_DATA_DIR"/data_log/{elastic/data,elastic/logs,kafka,redis/data,redis/log}
chmod -R 777 "$VSS_DATA_DIR/data_log"
 
cd ~/vss-public/deploy/docker
docker compose \
  --env-file developer-profiles/dev-profile-lvs/.env \
  -f compose.yml \
  up -d

Compose 堆栈使用启用 RAG 的配置启动所有基础架构 ( VST、Redis、Elasticsearch、LVS、NIM) 和智能体。dev-profile 辅助工具 ./deploy/docker/scripts/dev-profile.sh up --profile lvs --hardware-profile H100 执行相同操作,并为您创建数据目录。

第 4 步:验证服务是否正常

请注意,NIM 加载可能需要 5 到 15 分钟。

docker ps --format 'table {{.Names}}\t{{.Status}}\t{{.Ports}}'
curl -sS http://localhost:8000/health      	# VSS agent
curl -f http://127.0.0.1:38111/v1/ready     	# LVS backend
curl -f http://127.0.0.1:8018/v1/health/ready   # RT-VLM
curl -f http://127.0.0.1:30081/v1/health/ready  # LLM NIM

NemoClaw 设置

NemoClaw 充当编排层,配置沙盒、网络策略和技能,使其能够推动整个工作流程。

第 1 步:运行 NemoClaw 安装程序 

从存储库根目录;NEMOCLAW_PROVIDER 为必填项;对 NVIDIA 托管的模型使用 build

NEMOCLAW_PROVIDER=build \
NVIDIA_API_KEY="$NVIDIA_API_KEY" \
  bash deploy/docker/scripts/nemoclaw/init_nemoclaw.sh demo

此单一命令可处理完整设置:它搭载 NemoClaw,配置模型提供程序,应用 VSS 沙盒策略 (允许沙盒访问端口 8000 上的 VSS 代理) ,将存储库技能 (包括 vss-generate-video-report-rag) 作为 OpenClaw 插件安装到沙盒中,并打印 OpenClaw UI URL。 

要使用您自己的兼容 OpenAI 的端点 (例如本地 vLLM) :

NEMOCLAW_PROVIDER=custom with NEMOCLAW_ENDPOINT_URL and COMPATIBLE_API_KEY

第 2 步:测试端到端工作流程

nemoclaw SANDBOX_NAME connect
openclaw tui

OpenClaw UI 现已打开。接下来的两个操作发生在该 UI 中,而不是您的 shell 中:

  1. 输入/new,然后按 Enter 以启动全新会话。
  2. 以消息形式输入您的请求,然后按 Enter:我要为 <VIDEO_NAME> 生成视频摘要报告。

然后,智能体通过 HITL 提示收集分析参数,使用 LVS 和 RAG Blueprint 生成报告,并可以创建 Jira 工单或根据结果发送通知。

端到端工作流的延迟和性能

添加 NemoClaw 编排和 HITL 参数收集可将延迟用度降至最低。HITL 阶段是异步的,NemoClaw 和人类用户在系统待机时进行交互,因此一旦参数得到确认,视频处理就会继续进行。

各行业和 NVIDIA 合作伙伴如何使用 NemoClaw、VSS 3 和 RAG Blueprint?

视频理解、知识检索和代理式编排的结合解锁了各行各业的新功能。以下是合作伙伴部署此解决方案的方式。

  • Computacenter 在 Run:AI 集群上部署了完整的 DETECT → REASON → ACT 工作流,用于进行预测性维护,使用 VSS 3 分析无人机、管道镜和热检查画面,使用 RAG Blueprint 分析 OEM 环境,并使用 NemoClaw 自动起草 Maximo 工作订单—将四个资产类别的素材到工作订单的时间从 30 – 45 分钟缩短到大约 19 秒。
  • VAST Data 使用 NemoClaw 在 VAST DataEngine 上编排实时 VSS 工作流,通过 VastDB 和向量使用 VAST RAG 处理实时游戏流;它基于 NVIDIA 蓝图构建,具有 cosmos-reason2 和 Nemotron,可在 NVIDIA DSX AIR 上端到端运行。

切实可行的视频 AI 有哪些优势?

VSS 3、RAG Blueprint 和 NemoClaw 的集成代表了企业视频分析方式的根本性转变。视频分析通常会生成静态报告。了解视频中发生的情况需要手动解释和手动操作启动。

借助此集成式解决方案,视频理解现已成为起点。代理式编排将这种理解转化为协调行动,包括创建工单、提醒团队、比较模式、升级异常,以及将结果输入下游工作流。

具有重大意义:

  • 速度:响应时间从几小时或几天缩短到几分钟。
  • 扩展:分析来自多个来源的数千个视频,并揭示整个企业的模式。
  • 一致性:始终如一地应用参考知识 (政策、程序、法规、指南) 。
  • 问责:每项决策都可以追溯到视频证据和原始文档。
  • 自动化:常规工作流程(警报生成、工单创建、文档)无需人工干预即可运行。

这就是企业级视频 AI 的样子:专用分析引擎 ( VSS 和 RAG 蓝图) 由通用代理式工作流 (NemoClaw) 组成,将组织智能嵌入到每个决策中。

开始使用切实可行的企业级视频 AI

VSS、RAG Blueprint 和 NemoClaw 共同阐明了一个更广泛的架构原则:没有一个单一的模型或服务是解决每个问题的最佳选择,但通过简洁、定义明确的 API 组成的专用系统可以提供超过其各个部分总和的功能。这样做无需牺牲企业部署所需的模块化、可扩展性和治理能力。

结果重新定义了视频分析的用途。视频理解不再以等待人工解释的静态报告终止,而是成为编排工作流的切入点,该工作流可检索相关组织知识,为每个结论提供证据依据,并自动推动下游行动。

企业可以在生成视频见解后,以一致的方式大规模地快速对其采取行动。视频片段已经被截取。下一个机会是将其转化为协调、负责任的行动,现在已经有了这样做的蓝图。准备好开始了吗?使用本文中介绍的步骤,交换您自己的视频源和参考知识,例如与 OEM 手册配对的检查片段、与营销政策配对的零售店摄像头,或与规则手册配对的直播。

克隆 VSS 存储库,部署启用知识检索 (Frag) 的 VSS 智能体,将 RAG Blueprint 指向您的文档,然后将 NemoClaw 连接到您团队已使用的系统,例如 Jira、Slack、数据库或工单队列。从视频到决策再到行动的循环循环开始,端到端试点,然后继续扩展。

标签