开发工具与技巧
2026年 9月 22日
借助 NVIDIA Topograph 实现拓扑感知型工作负载调度
AI 工厂是功率受限的系统,在完全优化时可提供最大价值。GPU 工作负载布局是一项关键优化。糟糕的工作负载放置分散了拓扑域,
4 MIN READ
2026年 9月 21日
借助 NVIDIA Dynamo-Triton 中的 NVIDIA TensorRT 多设备集成,简化跨多个 GPU 的模型服务
生成式 AI 对计算和内存的需求日益超出单个 GPU 的能力。NVIDIA TensorRT 多设备推理是一项新功能,
3 MIN READ
2026年 9月 21日
借助 NVIDIA Earth-2,将您的最新观测结果转化为及时的天气决策
越来越多的天气敏感型行业可以获得观测结果,从而更早、更局部地了解不断变化的天气状况。能源公司收集风能和太阳能资产的测量数据,
4 MIN READ
2026年 9月 18日
借助 AIPerf 对 LLM 进行大规模基准测试推理
在系统上部署模型。启动后,提示得到响应。难题是:速度快吗? 直觉可能会引导您发送 curl 命令、手动滚动异步脚本或另一个一次性负载生成器。
3 MIN READ
2026年 9月 16日
使用代理式 AI 将 CUDA Tile 操作从 Python 转换为 Rust
cuTile Rust () 是一个基于图块的系统,用于使用 Rust 编程语言进行安全的惯用 GPU 内核创作。
5 MIN READ
2026年 9月 14日
借助 NVIDIA Transformer 引擎在 JAX 中加速无模型 MoE 训练
多专家模型 (MoE) 已成为大规模 AI 模型训练中的关键架构趋势之一。DeepSeek、Qwen 和 Mixtral 是 MoE…
4 MIN READ
2026年 9月 10日
全栈 NIM 优化如何在 Nemotron 3 Ultra 上为用户提供 2.5 倍的提升
部署大语言模型只是实现生产就绪型服务的第一步。制作团队还需要在可用的 GPU 基础架构上为尽可能多的并发用户提供服务,
2 MIN READ
2026年 9月 9日
何时使用“编码-预填充-解码”解耦技术来加速多模态模型服务
编码 – 预填充 – 解码 (EPD) 分解是一种适用于多模态模型的推理优化技术,可将视觉编码器阶段与预填充和解码阶段分离开来。
4 MIN READ
2026年 9月 9日
CUDA 工具包 13.4 在 Arm 上添加了 Windows 支持,并增强了对共享 GPU 的控制
每个 NVIDIA CUDA 工具包版本都增加了功能和性能改进,帮助开发者从 NVIDIA GPU 和更广泛的 NVIDIA…
4 MIN READ
2026年 9月 8日
介绍 CUDA Rust:用于编写 GPU 内核的两条轨道
2026 年 9 月,NVIDIA 宣布将在 Rust 中采用原生 GPU 编程。CUDA C++ 和 CUDA Python…
4 MIN READ
2026年 9月 8日
GR-Inference:面向生成式推荐的推理系统设计与性能评估
基于 Semantic ID(SID)的生成式推荐,将推荐过程转化为短序列自回归生成。这类负载不同于 Chat LLM 的常规生成:
2 MIN READ
2026年 9月 4日
使用 NVIDIA NemoClaw 构建内存驱动型智能体
企业工作涵盖随时间变化的AI 智能体必须先对其进行重建,然后再进行贡献。 为了向智能体提供这种必要的环境,
1 MIN READ
2026年 9月 3日
如何在联邦 Kubernetes 和 AI 平台上携带用户身份
现代 AI 平台不再是单一登录屏幕背后的单一应用。用户可以从中央门户开始,打开受治理的数据集,启动数据所在的 Notebook,
2 MIN READ
2026年 9月 2日
现代 CUDA 工具箱的实际应用:分步优化演练
NVIDIA CUDA 仍然是 GPU 加速计算的基础,为从科学模拟到大规模 AI 训练的一切提供支持。 但是,编写正确、
7 MIN READ
2026年 9月 2日
使用预测解码共同设计 AI 模型,加快 LLM 推理速度
本文是关于 AI 模型协同设计的系列文章中的第三篇。它探讨了如何使用预测性解码在保持准确性的同时加速 LLM 推理,
4 MIN READ
2026年 8月 31日
运行 NVIDIA BioNeMo NIM 微服务,在 Claude Science 中进行蛋白质结构预测
代理式 AI 正在改变研究方式。AI 科学家可以阅读论文、提出假设、调用模型,并确定下一步要优先进行的实验。
5 MIN READ