CUDA
2026年 9月 22日
使用 AI 智能体和 NVIDIA Isaac ROS 加速 ROS 2 节点
GPU 加速可以加速计算密集型机器人工作负载,但仅凭快速的 CUDA 内核并不能保证快速的 ROS 2 图形。当消息在节点之间移动时,
3 MIN READ
2026年 9月 16日
使用代理式 AI 将 CUDA Tile 操作从 Python 转换为 Rust
cuTile Rust () 是一个基于图块的系统,用于使用 Rust 编程语言进行安全的惯用 GPU 内核创作。
5 MIN READ
2026年 9月 10日
使用 BioNeMo 推理运行时进行高吞吐量结构预测
生物分子结构预测现在通常以蛋白质组规模运行,其目标是高效地将整个工作列表移动到工作流中。
3 MIN READ
2026年 9月 9日
CUDA 工具包 13.4 在 Arm 上添加了 Windows 支持,并增强了对共享 GPU 的控制
每个 NVIDIA CUDA 工具包版本都增加了功能和性能改进,帮助开发者从 NVIDIA GPU 和更广泛的 NVIDIA…
4 MIN READ
2026年 9月 8日
介绍 CUDA Rust:用于编写 GPU 内核的两条轨道
2026 年 9 月,NVIDIA 宣布将在 Rust 中采用原生 GPU 编程。CUDA C++ 和 CUDA Python…
4 MIN READ
2026年 9月 8日
GR-Inference:面向生成式推荐的推理系统设计与性能评估
基于 Semantic ID(SID)的生成式推荐,将推荐过程转化为短序列自回归生成。这类负载不同于 Chat LLM 的常规生成:
2 MIN READ
2026年 9月 2日
现代 CUDA 工具箱的实际应用:分步优化演练
NVIDIA CUDA 仍然是 GPU 加速计算的基础,为从科学模拟到大规模 AI 训练的一切提供支持。 但是,编写正确、
7 MIN READ
2026年 8月 31日
运行 NVIDIA BioNeMo NIM 微服务,在 Claude Science 中进行蛋白质结构预测
代理式 AI 正在改变研究方式。AI 科学家可以阅读论文、提出假设、调用模型,并确定下一步要优先进行的实验。
5 MIN READ
2026年 8月 25日
在 NVIDIA Dynamo 中借助阴影引擎恢复在数秒内恢复 LLM 推理能力
当 LLM 引擎进程失败时,标准恢复路径涉及冷重启。这需要从存储中将权重加载到 HBM 中,编译内核并捕获 NVIDIA CUDA 计算图。
3 MIN READ
2026年 8月 25日
CUDA Python 1.0:稳定的 API、一个基础、完整的平台访问
多年来,需要 GPU 的 Python 开发者有两种现实选择:一是充分学习 NVIDIA CUDA C++ 以编写扩展程序,
2 MIN READ
2026年 8月 20日
生成式推荐系统如何大规模重新定义 RecSys
推荐系统 (RecSys) 是消费互联网行业最常见的机器学习问题之一,但众所周知,很难进行大规模训练和服务。
3 MIN READ
2026年 8月 18日
AI 编码智能体如何借助 NVIDIA ALCHEMI 工具包解锁材质模拟
原子模拟需要三件事:科学知识、模拟的计算高效实现,以及模拟堆栈的可访问接口。 第一个领域仍然是研究人员的研究领域,
4 MIN READ
2026年 7月 30日
使用 NVIDIA nvmath-python 大规模运行高性能核心数学运算
NVIDIA nvmath-python 是一个库,旨在弥合 Python 科学社区与 NVIDIA CUDA-X 数学库之间的差距。
5 MIN READ
2026年 7月 23日
使用 NVIDIA OptiX 工具包调试光线追踪应用
NVIDIA OptiX 光线追踪引擎是一种应用框架,可在 GPU 上实现出色的光线追踪性能。
2 MIN READ
2026年 7月 15日
在 NVIDIA CUDA 13.3 中使用无带乘法构建更快的加密技术
15 年多来,x86 CPU 一直附带用于无携带乘法的专用硬件指令。它是一个小但却很棘手的基元,位于经过身份验证的加密、
3 MIN READ
2026年 7月 10日
NVIDIA CUDA 中的内核融合:优化内存流量并启动开销
针对 GPU 优化代码的方法有很多。在本文中,您将了解内核融合如何提高内存带宽并减少内核启动用度,
4 MIN READ