最近文章
2026年 9月 9日
何时使用“编码-预填充-解码”解耦技术来加速多模态模型服务
编码 – 预填充 – 解码 (EPD) 分解是一种适用于多模态模型的推理优化技术,可将视觉编码器阶段与预填充和解码阶段分离开来。
4 MIN READ
2026年 9月 9日
CUDA 工具包 13.4 在 Arm 上添加了 Windows 支持,并增强了对共享 GPU 的控制
每个 NVIDIA CUDA 工具包版本都增加了功能和性能改进,帮助开发者从 NVIDIA GPU 和更广泛的 NVIDIA…
4 MIN READ
2026年 9月 8日
介绍 CUDA Rust:用于编写 GPU 内核的两条轨道
2026 年 9 月,NVIDIA 宣布将在 Rust 中采用原生 GPU 编程。CUDA C++ 和 CUDA Python…
4 MIN READ
2026年 9月 8日
GR-Inference:面向生成式推荐的推理系统设计与性能评估
基于 Semantic ID(SID)的生成式推荐,将推荐过程转化为短序列自回归生成。这类负载不同于 Chat LLM 的常规生成:
2 MIN READ
2026年 9月 4日
使用 NVIDIA NemoClaw 构建内存驱动型智能体
企业工作涵盖随时间变化的AI 智能体必须先对其进行重建,然后再进行贡献。 为了向智能体提供这种必要的环境,
1 MIN READ
2026年 9月 4日
前沿推理触手可及:如何在 NVIDIA Jetson 上部署和优化模型
在边缘运行推理和代理式 AI 比以往更加困难。直到最近,能够进行多步骤推理的模型还过于庞大,无法在边缘硬件上本地运行。
3 MIN READ
2026年 9月 3日
如何在联邦 Kubernetes 和 AI 平台上携带用户身份
现代 AI 平台不再是单一登录屏幕背后的单一应用。用户可以从中央门户开始,打开受治理的数据集,启动数据所在的 Notebook,
2 MIN READ
2026年 9月 3日
NVIDIA PAIR 虚拟推理路由器可扩展您本地网络中的可用算力
AI 智能体正在通过合作学习做更多事情。首席智能体可以将复杂的任务分解为较小的作业,并将这些作业分配给专门的子智能体。此外,
2 MIN READ
2026年 9月 2日
现代 CUDA 工具箱的实际应用:分步优化演练
NVIDIA CUDA 仍然是 GPU 加速计算的基础,为从科学模拟到大规模 AI 训练的一切提供支持。 但是,编写正确、
7 MIN READ
2026年 9月 2日
使用预测解码共同设计 AI 模型,加快 LLM 推理速度
本文是关于 AI 模型协同设计的系列文章中的第三篇。它探讨了如何使用预测性解码在保持准确性的同时加速 LLM 推理,
4 MIN READ
2026年 9月 1日
使用 NVIDIA Nemotron 构建自适应代理式网络安全系统
AI 正在改变网络安全的步伐。代理式系统可以协调工作并长期追求复杂的目标。安全团队开始在安全运营中应用智能体,但许多实施仍然依赖于现有警报、
2 MIN READ
2026年 9月 1日
构建面向大规模 VLA 的端云协同后训练闭环:使用 verl-vla 统一数据采集、微调与强化学习
随着 NVIDIA Isaac GR00T、PI0.5 等大规模视觉—语言—动作(VLA)模型不断发展,
2 MIN READ
2026年 9月 1日
如何在不超支的情况下调整 GPU 大小以实现 AI 推理和 TCO
AI 采用率的激增正在改变从聊天机器人到内容生成的方方面面。尽管如此,一个常见的痛点仍然存在:
3 MIN READ
2026年 8月 31日
运行 NVIDIA BioNeMo NIM 微服务,在 Claude Science 中进行蛋白质结构预测
代理式 AI 正在改变研究方式。AI 科学家可以阅读论文、提出假设、调用模型,并确定下一步要优先进行的实验。
5 MIN READ
2026年 8月 31日
借助 NVIDIA Omniverse NuRec 在车辆平台上扩展智能汽车感知
感知堆栈由搭载该堆栈的车辆决定形状。将相同的软件移动到新的赛车系 (例如,从 SUV 到轿车或产品组合中的其他车型) ,
4 MIN READ
2026年 8月 28日
借助 NVIDIA TensorRT Model Connect,在两个命令中部署从检查点到推理的开放模型
开放 AI 模型的发展速度远超以往,但将其引入本地应用仍然需要模型特定的转换、预处理、后处理和运行时代码。
2 MIN READ