NCCL
2026年 8月 25日
在 NVIDIA Dynamo 中借助阴影引擎恢复在数秒内恢复 LLM 推理能力
当 LLM 引擎进程失败时,标准恢复路径涉及冷重启。这需要从存储中将权重加载到 HBM 中,编译内核并捕获 NVIDIA CUDA 计算图。
3 MIN READ
2026年 8月 21日
适用于大规模金融工具的 GPU 加速集群
使用 AdaptGrow (一种 GPU 加速的矩阵分解算法) 将滚动相关性和尾依赖性矩阵转换为硬集群、
3 MIN READ
2026年 8月 12日
如何为 NVIDIA AI 工厂选择全栈可观察性
AI 基础架构跨越多个层,从计算和网络到存储、编排和应用。当性能下降时,识别来源可能很困难,因为在某一层观察到的症状可能源于堆栈中的其他地方。
3 MIN READ
2026年 6月 25日
使用 NVIDIA TensorRT 和多设备推理支持,跨多个 GPU 扩展 AI 推理
生成式 AI 工作负载的显存和计算预算正迅速超出单个 GPU。对于构建媒体生成工作流的推理开发者而言,
4 MIN READ
2026年 2月 3日
在 JAX 和 XLA 中加速长上下文模型训练
大语言模型(LLM)的上下文窗口正在迅速扩展,近期的模型已支持128K、256K甚至更长的词元序列。然而,
3 MIN READ
2024年 3月 6日
CUDA 工具包 12.4 增强对 NVIDIA Grace Hopper 和机密计算的支持
最新版本的 CUDA 工具包,即 版本 12.4,继续利用最新的 NVIDIA GPU 来推动加速计算性能。
3 MIN READ