计算机视觉/视频分析

使用代理技能在一天内对 NVIDIA Cosmos 3 进行后训练

如果自主编码 AI 智能体 能够在几乎无需人工操作的情况下将您的视觉推理模型的准确率提高 90% 以上,那该多好?在根据生产视频任务调整视觉推理模型时,开发者通常需要花费数天时间来处理数据格式化、容器设置、训练脚本、基准评估和超参数扫描,然后才能知道后训练是否能提高准确性。

将开放物理 AI 世界基础模型 NVIDIA Cosmos 3NVIDIA TAO 智能体技能 相结合,为应对这一挑战提供了解决方案。Cosmos 3 通过共享的全模态世界模型将理解、生成、模拟和行动联系起来。它在 混合转换器 (MoT) 架构下统一了文本、图像、视频、环境声音和动作追踪。虽然该模型提供出色的开箱即用视觉推理,但每个现实世界的部署都需要领域专门化,以处理独特的摄像头角度、边缘情况和环境。这正是后期训练的重要性所在。

本文将介绍如何使用编码代理和 NVIDIA TAO 视觉模型代理式微调技能库无缝地对 NVIDIA Cosmos 3 Nano 模型进行后期训练,以进行视频问答。

NVIDIA 的实验表明,通过使用 低秩自适应 (LoRA) ,该工作流可以高效地调整模型,在单次运行中将零样本基准从 54.41% 的精确匹配准确率 ( 4 路多选) 提高到 87.14%,令人印象深刻。通过利用 TAO AutoML 来系统化地扫描配置并消除猜测,它将峰值准确率提高到 93.35%,将原本需要多日的工程工作压缩到由一些自然语言提示驱动的单日自动执行中。

视频 1. 从设置到 AutoML 扫描和最终报告,逐步了解如何使用 NVIDIA TAO 后训练 Cosmos 3 Nano 智能体技能

Cosmos 3 MoT 架构有哪些优势?

NVIDIA Cosmos 3 MoT 架构使用自回归 Transformer 进行稳健的推理和规划,并与扩散 Transformer 配合使用,以准确预测未来的世界状态和行动。Cosmos 3 提供多种尺寸 (包括 Super 64BNano 16B ) ,在基准测试中一直在开放模型中排名第一,包括:

图 1 展示了统一的双塔设计,分为自回归推理通路和迭代扩散生成通路。特定于模态的输入通过单独的 LayerNorm 和 MLP 块进行标记化和处理,并通过跨流连接进行交互,其中键值状态 (KAR、VAR) 会传递到生成式全注意力块,以用于文本和视觉上下文。

哪种后训练方法最适合 Cosmos 3 Nano?

Cosmos 3 等基础模型从大量多样的数据集中学习通用模式。后训练对于帮助模型更好地理解专业领域任务、词汇和特定摄像头视角至关重要。

对于 Cosmos 3 Nano 等后训练视觉语言推理模型,开发者通常会在两种方法中进行选择:

  • 全参数监督式微调 (SFT):当域偏移较大或任务需要更改结构模型时,效果最佳。但是,由于 SFT 会更新所有模型权重,因此需要大量计算资源,并且可能会在一般知识方面出现回归。
  • 低秩自适应 (LoRA):非常适合快速迭代。LoRA 会冻结基础模型权重,并注入可训练的秩分解矩阵。

在本文中详细介绍的示例中,与 Cosmos 3 Nano 的全参数 SFT 相比,LoRA 后训练所需的 GPU 小时数大约减少了 7 倍,这使得工程团队能够在训练后实现为期一天的周转。

对于如何对 Cosmos 3 Nano 进行后训练,有哪些选项?

对于如何对 Cosmos 3 Nano 进行后训练,有两个选项:

  • 开放框架:完全开放的 Cosmos 3 后训练框架可直接公开训练方法、数据集格式和配置文件,因此您可以构建和拥有后训练流程的每一步。如果您需要自定义训练逻辑或想要与现有基础架构集成,这是个很好的选择。
  • TAO 智能体技能: 这些技能建立在相同的能力之上,并实现自动化。编码智能体可为您执行工作流推理、修补数据问题、运行训练容器并扫描超参数。这种自动化将多日设置压缩为以下章节中概述的为期一天的双提示体验。

NVIDIA TAO 引入智能体技能,帮助编码智能体为受支持的模型系列执行视觉模型后训练工作流。这些技能整合了训练、评估、优化和提供模型所需的任务特定知识,包括框架详细信息、启动器行为、配置结构、数据加载和评估工作流。

借助 TAO 技能,编码智能体无需手动组装每个命令和配置文件,而是能够在工作流中进行推理并生成正确的步骤。

Cosmos 3 架构将其功能分离为 Reasoner 塔 (用于多模态理解和逻辑的视觉语言模型) 和 Generator 塔 (用于视频和动作生成) 。使用 TAO 智能体技能时,工作流程会自动处理这些权重分离,确保您的后训练专门针对下游任务并仅优化推理器权重。

如何为编码智能体安装 TAO 技能

可以安装 TAO 技能集供任何编码代理使用。此示例使用了 Codex。NVIDIA-TAO/tao-skill-bank 中也为 Claude 提供了类似的设置说明 NVIDIA-TAO/tao-skill-bank

GitHub 存储库。最快的设置路径是使用 TAO 技能库中的自动安装脚本。

curl -fsSL https://raw.githubusercontent.com/NVIDIA-TAO/tao-skills-bank/main/scripts/install-codex-agents.sh | bash

如果您希望自己执行每个步骤,库也会将脚本分解为步骤。

在开始实验之前,请使用所需的关键帧填充您的终端环境:

export HUGGINGFACE_TOKEN="your_hf_token" #To pull missing models
export NGC_API_KEY="your_ngc_key" #For TAO Docker containers
export AUTOML_LLM_API_KEY="your_llm_key" #Required for LLM-guided hyperparameter sweeps in AutoML

数据集

此示例展示了如何使用丰田的 Woven Traffic Safety (WTS) 数据集 对 Cosmos 3 Nano 进行后期训练。该实验侧重于四路多选视频问答任务,其中包含 8000 多个训练和验证样本。

此数据集有助于演示 Cosmos 3 的后训练,因为交通安全需要详细的现实世界场景理解。该模型必须对视频中的复杂道路布局、信号、车辆、行人和事件背景进行推理 (图 3) 。但同样的工作流也适用于任何下游视觉推理任务,例如仓库监控、智能汽车感知、机器人工作单元等。

数据集示例

问题:道路的形成是什么?

  • A:单条道路 (右曲线)
  • B:单路 (直线)
  • C:相交 (无信号)
  • D:相交 (带信号)

预期答案:D

如何使用单个提示运行 LoRA 后训练

在导出凭据的相同环境中,您可以使用单个 Codex 提示启动整个端到端工作流:

Perform LoRA post-training of the Cosmos 3 model on the Woven Traffic Safety dataset.
Training data: /home/…/WTS_dataset/wts_data_train
Validation data: /home/…/WTS_dataset/wts_data_val
Base model on Hugging Face: nvidia/Cosmos3-Nano
Also perform a baseline evaluation first, to compare with the post-trained model.

在后台,Codex 会查询 TAO 库并选择专业的 Cosmos 推理技能。智能体自主处理底层框架和数据加载器,并依次执行以下操作:

  1. 自动错误修补:智能体扫描数据集注释,标记缺失的视频 FPS 参数,并即时应用配置修补程序。
  2. 模型缓存: 它使用 Hugging Face 令牌安全地提取 Cosmos 3 的权重。
  3. 基准评估:在更改任何权重之前,它会运行零样本基准评估。基础 Cosmos 3 模型的初始准确率为54.41%
  4. LoRA 工作流执行:智能体生成经过优化的 LoRA 训练配置,并触发 TAO 训练容器。

后训练完成后,智能体将评估 LoRA 自适应模型,并将结果与基准进行比较。

只需运行一次,在 8 个 NVIDIA A100 Tensor Core GPU 上训练大约 30 分钟,该模型的准确率就会跃升至 87.14%,大幅提升了 32 个百分点,完全无需手动操作。

如何使用 TAO AutoML 优化视觉模型

LoRA 提供了强大的第一个结果,但后训练性能通常取决于选择正确的配置。学习率、LoRA 秩、dropout、批量大小、调度器设置和其他超参数都会影响最终准确性。

TAO AutoML 允许智能体对重要的后训练参数进行结构化扫描,而不是一次手动尝试一种配置。

TAO AutoML 支持一系列参数搜索策略,包括但不限于:

  • 贝叶斯优化
  • 超带
  • 贝叶斯优化和 Hyperband
  • 批量优先贝叶斯优化
  • LLM 引导搜索使用 LLM 大脑 ( NVIDIA NIM、OpenAI 或任何 OpenAI 兼容端点) 提供超参数。需要 NVIDIA_API_KEYAUTOML_LLM_API_KEY。在此实验中,我们使用了 Gemini API 端点。

有关每种算法的简要说明,请参阅 TAO AutoML 算法文档

借助同一编码智能体聊天中的另一个提示,您可以要求智能体运行 AutoML 扫描:

Run an AutoML sweep to improve the LoRA result. Let TAO choose suitable search strategies 
and tune the important training hyperparameters. Optimize validation accuracy and summarize 
the best models.

智能体使用多种策略生成候选试验,启动每个实验,跟踪超参数,评估结果,并记录最佳配置。

LoRA 和 AutoML 提供了哪些准确性改进?

通过将 TAO 智能体技能的自动化与 TAO AutoML 的优化能力相结合,该模型在零样本基准方面实现了出色的准确性提升。只需两个提示,整个实验就从未对齐的基础模型发展为高度专业化的交通安全专家。

模型变体 策略 验证准确性 与基准对比
Cosmos 3 Nano (基础版) 零样本基准 54.41% 参考资料
Cosmos 3 Nano+ LoRA 单提示基准 LoRA 87.14% + 32.73 个百分点
Cosmos 3 Nano+ AutoML 贝叶斯优化 93.35% + 38.94 个百分点
表 1. Cosmos 3 Nano 在不同的后训练策略中的验证准确性提升 

预期的硬件和运行时间是多少?

基于云的 NVIDIA 硬件用于测试 TAO 技能的多配置实验扫描。得益于 Cosmos 3 MoT 架构的高效率,在 NVIDIA A100 (80 GB) GPU 节点上,单个 LoRA 后训练周期大约需要 30 分钟。这意味着,在一小时内,您可以快速启动高精度模型,准确率为 87.14%。

但是,作为一项重要的澄清,如果您想将准确性提高到此值以上,则需要使用 TAO AutoML 超参数扫描来找到最佳配置。在此实验环境中,处理 43 次并行试验需要 19.5 小时,并且完全在 Oracle Cloud Infrastructure (OCI) 上托管的多个 A100 GPU 节点上并行运行。

相比之下,在 NVIDIA H100 GPU 上运行完整参数 SFT 需要 3 小时 34 分钟。

定性的后训练结果是什么?

数字只能说明问题的一部分。在评估复杂、模糊的现实世界边缘案例时,可以看到领域专业化的真正价值。图 5 和图 6 显示了模型后训练前后的定性比较。

如何部署经过后训练的 Cosmos 3 LoRA 网卡

Cosmos 3 Reasoner NIM 提供了通往与 OpenAI 兼容的生产级 Reasoner 端点的最快路径。它具有隔离和优化的自回归推理器,专为高效的设备端推理而构建。NIM 微服务作为预构建、优化的容器提供,使您能够完全跳过手动 vLLM 依赖项或复杂的 CUDA 配对配置。

它以原生方式提供文本、图像和视频输入的文本输出。要部署经过后训练的模型,只需在部署期间将经过后训练的 LoRA 适配器目录直接传递给 NIM 环境即可。

观看视频教程:如何运行 NVIDIA Cosmos 3 Reasoner NIM 进行视频推理,获取使用 NIM 为 Cosmos 3 模型提供服务的分步说明。如需整合 LoRA 网卡,请参阅 NVIDIA NIM 文档

Cosmos 3 后期训练入门

从通用 AI 到高度专业化的物理 AI 的过渡不再需要与基础设施进行斗争。通过将 NVIDIA Cosmos 3 Reasoner 塔的结构推理能力与 NVIDIA TAO 智能体技能的自动化相结合,您可以在一天内从原始视频数据过渡到可部署的专用视觉语言模型。

借助两个自然语言提示,编码智能体可处理框架复杂性、修补数据错误、执行基准基准测试,并通过 TAO AutoML 完全无需手动运行高级超参数调优,让工程团队专注于解决核心物理 AI 和机器人开发挑战。

准备好后训练您自己的视觉推理模型了吗?查看以下资源,在本地开发环境中实施工作流程:

标签