一般
2026年 9月 9日
何时使用“编码-预填充-解码”解耦技术来加速多模态模型服务
编码 – 预填充 – 解码 (EPD) 分解是一种适用于多模态模型的推理优化技术,可将视觉编码器阶段与预填充和解码阶段分离开来。
4 MIN READ
2026年 9月 9日
CUDA 工具包 13.4 在 Arm 上添加了 Windows 支持,并增强了对共享 GPU 的控制
每个 NVIDIA CUDA 工具包版本都增加了功能和性能改进,帮助开发者从 NVIDIA GPU 和更广泛的 NVIDIA…
4 MIN READ
2026年 9月 8日
介绍 CUDA Rust:用于编写 GPU 内核的两条轨道
2026 年 9 月,NVIDIA 宣布将在 Rust 中采用原生 GPU 编程。CUDA C++ 和 CUDA Python…
4 MIN READ
2026年 9月 8日
GR-Inference:面向生成式推荐的推理系统设计与性能评估
基于 Semantic ID(SID)的生成式推荐,将推荐过程转化为短序列自回归生成。这类负载不同于 Chat LLM 的常规生成:
2 MIN READ
2026年 9月 4日
使用 NVIDIA NemoClaw 构建内存驱动型智能体
企业工作涵盖随时间变化的AI 智能体必须先对其进行重建,然后再进行贡献。 为了向智能体提供这种必要的环境,
1 MIN READ
2026年 9月 4日
前沿推理触手可及:如何在 NVIDIA Jetson 上部署和优化模型
在边缘运行推理和代理式 AI 比以往更加困难。直到最近,能够进行多步骤推理的模型还过于庞大,无法在边缘硬件上本地运行。
3 MIN READ
2026年 9月 2日
现代 CUDA 工具箱的实际应用:分步优化演练
NVIDIA CUDA 仍然是 GPU 加速计算的基础,为从科学模拟到大规模 AI 训练的一切提供支持。 但是,编写正确、
7 MIN READ
2026年 9月 1日
使用 NVIDIA Nemotron 构建自适应代理式网络安全系统
AI 正在改变网络安全的步伐。代理式系统可以协调工作并长期追求复杂的目标。安全团队开始在安全运营中应用智能体,但许多实施仍然依赖于现有警报、
2 MIN READ
2026年 9月 1日
构建面向大规模 VLA 的端云协同后训练闭环:使用 verl-vla 统一数据采集、微调与强化学习
随着 NVIDIA Isaac GR00T、PI0.5 等大规模视觉—语言—动作(VLA)模型不断发展,
2 MIN READ
2026年 9月 1日
如何在不超支的情况下调整 GPU 大小以实现 AI 推理和 TCO
AI 采用率的激增正在改变从聊天机器人到内容生成的方方面面。尽管如此,一个常见的痛点仍然存在:
3 MIN READ
2026年 8月 28日
借助 NVIDIA TensorRT Model Connect,在两个命令中部署从检查点到推理的开放模型
开放 AI 模型的发展速度远超以往,但将其引入本地应用仍然需要模型特定的转换、预处理、后处理和运行时代码。
2 MIN READ
2026年 8月 26日
如何使用 AI 智能体训练跨具身机器人导航策略
导航使机器人能够将感知和运动转化为有目的的自主性。与产生稳定运动的运动不同,导航必须用于不断定位机器人、解读不断变化的环境、选择路线,
4 MIN READ
2026年 8月 26日
在 NVIDIA GB300 NVL72 上使用 Qwen3.8-Flash-Next 进行代理式编码实验
阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构的预览,供开发者试验和评估。
2 MIN READ
2026年 8月 25日
CUDA Python 1.0:稳定的 API、一个基础、完整的平台访问
多年来,需要 GPU 的 Python 开发者有两种现实选择:一是充分学习 NVIDIA CUDA C++ 以编写扩展程序,
2 MIN READ
2026年 8月 24日
十亿瓦级 AI 和以太网演进:Spectrum-X 以太网如何重塑规则
生成式 AI 的迅猛发展从根本上改变了数据中心的设计。随着分布式模型训练的规模扩展到数十万个 GPU,
3 MIN READ
2026年 8月 24日
NVIDIA BlueField-4 为代理式 AI 工厂提供新的 Scale-In 网络基础设施
传统的云基础设施为可预测的通用工作负载和标准接口而设计。代理式 AI 工厂连接不同的用户、代理、应用、数据源和存储系统,
1 MIN READ