与自动驾驶或工业机器人不同,医疗机器人无法依靠互联网规模的数据采集或无限的现实世界实验。每次演示都需要专门的设备、临床专业知识以及接触患者或实验室环境的机会。这给开发者带来了三大基本挑战。
首先是数据鸿沟。训练现代机器人策略需要跨各种解剖结构和程序进行演示。大多数团队只进行数百次演示,而构建强大系统所需的演示数则数不胜数。但是,即使收集数百万次演示是可行的,最重要的案例仍然会丢失。这是因为医疗保健行业被长尾主宰。罕见的解剖结构、具有挑战性的患者生理状况、并发症和故障模式很少发生,因此无法在真实数据集中得到充分体现。然而,对于临床安全而言,这些都是最重要的案例。
这种数据鸿沟直接带来了第二个挑战:泛化。模仿学习势必会在数据分布的边缘停滞不前。强化学习 (RL) 提供了超越这一稳定状态的途径。RL 可以探索数百万次交互、制定压力测试策略,并从失败中吸取教训。为了有效地做到这一点,它需要足够逼真的仿真来生成有意义的策略,并且需要足够快速和可扩展的仿真来进行大规模训练。
第三个挑战是开发速度。医疗机器人开发依赖于台式 Phantom、尸体研究、动物模型和有限的临床评估。这些技术仍然必不可少,但其本身具有顺序性、成本高昂且难以扩展。目前,设计和算法的迭代需要几个月的时间,将总开发周期缩短到 4 – 7 年。
这三个挑战指向了同样缺失的基础架构:一个开放的 GPU 原生仿真框架,能够以机器人训练所需的保真度对设备解剖学的交互进行建模。
NVIDIA Medical Physics Simulation 框架是 NVIDIA Isaac for Healthcare 中的一个开源 GPU 加速功能,旨在填补这一空白。开发者可以在 NVIDIA Isaac Sim 和 NVIDIA 数字孪生中生成解剖学数据,模拟设备 – 解剖学交互和医学成像,并在 GPU 规模上训练强化学习策略。
适用于医疗健康机器人的 GPU 原生仿真框架
Medical Physics Simulation 提供基于经典物理学的求解器和基于生成式世界模型的模拟器,用于设备 – 解剖学交互的实时模拟,从而在整个医疗机器人领域实现 RL-ready 策略训练。这两个模块为交互式手术和介入模拟、机器人学习、合成数据生成和手术程序开发提供了一个模块化的研究和工程平台。它们非常适合机器学习工作流程,因为模拟和学习均在同一 GPU 上运行,从而避免了重复 CPU – GPU 内存传输的开销。
经典求解器
Endoluminal Simulation Module 已在 Isaac for Healthcare 中正式发布。它能够实时模拟诊断和介入治疗程序,其中包括在内腔中穿行的长而灵活的手术工具。它作为一个独立的软件包实施,因此可以独立集成到不同的工作流程和环境中。此初始版本展示了在透视引导下通过血管系统进行导管导航的情况。
该模块使用 NVIDIA Warp 和 Newton Physics 在 Python 中实现。这些灵活的仪器被建模为 Cosserat 棒,为模拟材料的弯曲、扭曲和拉伸变形提供了坚实的理论基础。为了在 GPU 上高效捕获这些一维棒的复杂非线性动力学,我们选择扩展位置动力学 (XPBD) 作为主要模拟方法。
XPBD 通常依赖于局部迭代约束投影。然而,对于长乐器,局部投影可能需要多次迭代才能将运动从受控的近端传播到远端。相反,此模块会将合杆约束条件组合成一个矩阵系统。
每个杆段会生成六个约束方程 (三个用于拉伸和剪切,三个用于弯曲和扭曲) ,从而生成一个包含 6 × 6 个块的块 – 三对角线 XPBD 系统。Thomas 算法以与仪器长度相关的线性时间求解此系统,而独立仪器则在 GPU 上的矢量化环境中并行处理。
这种全局合求解器会在每个仿真步骤中沿整个仪器传播输入 (例如近端插入和旋转) ,即使对于超长仪器也是如此,从而能够立即响应远端的用户操作。

模拟导管与血管的交互
此外,还可在 GPU 上并行评估导管与血管的交互。直接针对患者特定的三角形网格评估有符号最接近点查询,从而避免单独预先计算的距离场。当仪器样本穿透墙壁,同时保持切线滑动运动时,会被投射回流明。当前版本支持刚性单向封闭;计划在未来版本中对可变形体容器壁进行双向合。
控制输入直接通过杆的边界条件和静止状态来表示。插入操作沿引入器轴推进受限的近端,中心旋转设置其方向,远端转向修改最终杆段的剩余曲率,而不是施加人工外力。然后,弯曲和扭曲约束条件会将这些输入传播到仪器中。
连接物理、成像和机器人学习
Endoluminal Simulation 模块通过通用 API 保持与其他 Newton 求解器的兼容性。通过 wp.from_torch 和 wp.to_torch 提供的 Torch – Warp 互操作性可保持控制和强化学习接口的零复制和完全 GPU 驻留。这实现了与 NVIDIA Isaac Lab (一个专为大规模机器人学习设计的框架) 的直接集成。Isaac Lab 管理环境编排和部署控制,而求解器执行基于 GPU 的动态,并返回设备驻留张量以进行观察、奖励和控制循环。
这种物理和成像的协同设计支持大规模的高吞吐量策略训练,包括 512 个并行环境和 1500 次训练迭代的实验。报告的性能约为 1300 Hz (单环境物理) ,60 Hz (跨 512 个环境的物理模拟) ,63 FPS (完整模拟和渲染循环) ,分辨率为 256 × 256 像素。该平台还为直接从荧光图像和其他基于像素的观察结果中训练未来的策略奠定了基础。

导管导航工作流作为统一的模拟循环运行,该循环结合了两个特定于患者的组件。血管 – 数字生血管 – 数字孪生软件包可生成解剖衰减/ 几何伪影 ( mu_volume、血管掩膜/ 网格和中心线) ,而内腔模拟软件包可在 XPBD 约束下改进该解剖内的导管机制。对于每一帧,求解器状态会转换为可渲染的导管段,并由 fluorosim 合成到同一 CT 衍生成像域中。这可在一个端到端循环中保持物理和透视检查同步,同时额外的检测器响应效果可提高生成的透视图像的真实感。

手术模拟模块
抢先体验版中提供的手术模拟模块是一个由 GPU 加速的实时手术模拟框架,旨在通过触觉反馈和在统一的模拟流程中进行渲染,对软组织变形和手术相互作用进行建模。
与 Endoluminal Simulation 模块类似,它也使用 NVIDIA Warp 和 Newton Physics 在 Python 中实现。与整体式物理引擎不同,它将其功能组织为显式有序的仿真系统。每个程序都通过变形、碰撞、抓取、切割、裁剪、透热和渲染操作序列进行配置。这使得物理 GPU 工作流可被检查、配置和扩展。

软组织使用四面体网格表示。使用距离和体积保持限制,通过基于位置的动力学解决变形问题。在 GPU 上累积校正并取平均值,从而减少约束排序伪影,并支持高效的并行执行 ( Jacobi 求解器) 。
此外,仿真和可视化循环仍保留在 GPU 上,包括变形、碰撞查询、抓取、热扩散、拓扑更新和表面重建。NVIDIA CUDA 图形捕获可进一步减少核函数启动用度,而 GPU 到渲染器的直接数据传输 ( CUDA 互操作) 可避免不必要的 CPU/ GPU 复制。这可在一个消费级 GPU 上通过 8 个物理子步骤和 8 次内部变形约束迭代,实现每秒超过 30 帧的实时模拟。
此模块的初始版本支持端到端胆囊切除术 (胆囊移除) 。在模拟过程中,首先将机器人仪器插入膨胀的腹腔,可视化肝脏、胆囊和结缔组织等关键结构。其中包括剖析囊肿三角形、剪切囊性导管和动脉,以及将胆囊与肝脏分离。

用于手术模拟器的习得世界动力学和生成式物理学
医学物理模拟的生成式方法是物理求解器的辅助技术。生成式世界模型并非对每次交互都进行显式编程,而是从视频和其他数据中学习真实场景的外观及其随时间变化的方式。在训练期间,它会学习视觉观察、运动和调节信号 (例如机器人动作) 之间的关系。在推理时,它使用所学到的世界知识来预测下一个视频帧。
由于结果是在摄像头和机器人策略所看到的视觉空间中生成的,因此该模型可以重现难以手动构建的场景细节和外观。它还避免了为传统模拟器创建每个素材、材质和照明设置所需的大量手动工作。需要权衡的是,这些预测是从数据中学习的:它们在视觉上是逼真的,而无需为数值求解器提供明确的物理保证。
NVIDIA Cosmos 为这种方法提供了世界基础模型。Cosmos 视频模型使用基于流的扩散 Transformer 架构,并采用修正流公式。在生成过程中,该模型会迭代地将压缩视频表示中的噪声转换为来自学习数据分布的一致性样本。视频分词器将像素空间帧压缩为这种隐表示,以实现高效建模,并将生成的隐表示解码回视频。多模态调节使生成的未来变得可控。对于医疗应用,基于领域数据的后训练可先于专门的解剖、设备、程序和动力学调整广泛的视觉模型。
使用 Cosmos-H 进行生成式模拟
Cosmos-H 系列展示了几种形式的生成式医学物理模拟。Cosmos-H -Surgical-Predict 根据初始图像和文本预测未来可能出现的手术视频。Cosmos-H -Surgical-Transfer 可在深度、边缘、分割或模糊等控制项的引导下生成手术视频。Cosmos-H -Surgical-Simulator 预测直接基于手术机器人运动学的未来帧。
这些模型共同支持从合成数据生成和受控域传输到基于动作的机器人训练和策略评估等用例。它们不会取代每个场景中的显式物理特性,但会减轻场景创作负担,并在无法实现完整的第一性原理建模的情况下提供逼真的观察级模拟。
Cosmos-H -Dreams 将这种方法扩展到交互式模拟。它是一位蒸馏的教师,经过 Cosmos-H -Surgical-Simulator 的微调,成为一个因果的、几步式的学生,可以根据机器人的动作自回归地流式传输未来的手术视频。它通过 FlashDreams 推理引擎提供服务,将高质量的离线世界模型转变为实时环境,帧生成速度超过每秒 30 帧。环境可以由人类操作员控制,也可以通过单个工作站 GPU 上的习得机器人策略在闭环中进行查询。
为什么医疗机器人需要这两种方法
医疗健康领域的 Isaac 支持传统和生成式仿真,以满足医疗健康机器人的互补需求。为了提供用户信任和定量质量评估 (这是任何医疗健康解决方案的基础) ,经典模拟提供的物理一致性和确定性建模环境至关重要。反过来,生成式模拟能够以经典模拟无法实现的规模生成多样化且视觉上逼真的环境,从而在数据合成和实时临床工作流程中实现临床应用。
开始使用医学物理模拟
Isaac for Healthcare 中的医学物理仿真为开发者提供了构建模块,用于创建特定于患者的数字孪生、模拟设备解剖学交互、生成合成体验,以及训练智能医疗机器人系统。以下资源可帮助您开始使用每种模拟功能。
构建内膜机器人工作流
使用 GPU 加速的物理特性、解剖学数字孪生和模拟医学成像构建特定于患者的导管导航模拟。
Cosmos-H Dreams 生成式手术模拟
Cosmos-H Dreams 能够使用世界基础模型,以可扩展的方式生成逼真的手术体验。开发者可以使用预训练模型、运行交互式模拟,或根据新程序和机器人具身调整框架。
- 运行 Cosmos-H 梦想。开始使用预训练检查点、示例和交互式仿真工作流GitHub 资源库。
- 下载 Cosmos-H Dreams 模型。
通过网络访问预训练模型的 Checkpoint 和配置
Hugging Face 检查点。 - 创建自定义 Cosmos-H Dreams 模型。
Cosmos-H Dreams 不限于框架中包含的程序和机器人。
从以下两种方法中选择一种,为您自己的化身构建实时模拟器:- Extend Cosmos-H:
- 按照 Cosmos-H -Surgical-Simulator 的训练指南对您的数据进行微调。
- 蒸馏是经过微调的检查点,可实时扩展到几个步骤
吞吐量
蒸馏指南。 - 使用
--pipeline.diffusion-model.transformer.checkpoint-path。
- 引入您自己的模型:
如果您开始使用不同的视频扩散架构或在
专有数据集
上训练的模型,将其集成到
FlashDreams,
助力 Cosmos-H Dreams 的高性能推理运行时。
- Extend Cosmos-H: