常规
2026年 9月 9日
何时使用“编码-预填充-解码”解耦技术来加速多模态模型服务
编码 – 预填充 – 解码 (EPD) 分解是一种适用于多模态模型的推理优化技术,可将视觉编码器阶段与预填充和解码阶段分离开来。
4 MIN READ
2026年 9月 9日
CUDA 工具包 13.4 在 Arm 上添加了 Windows 支持,并增强了对共享 GPU 的控制
每个 NVIDIA CUDA 工具包版本都增加了功能和性能改进,帮助开发者从 NVIDIA GPU 和更广泛的 NVIDIA…
4 MIN READ
2026年 9月 8日
介绍 CUDA Rust:用于编写 GPU 内核的两条轨道
2026 年 9 月,NVIDIA 宣布将在 Rust 中采用原生 GPU 编程。CUDA C++ 和 CUDA Python…
4 MIN READ
2026年 9月 4日
使用 NVIDIA NemoClaw 构建内存驱动型智能体
企业工作涵盖随时间变化的AI 智能体必须先对其进行重建,然后再进行贡献。 为了向智能体提供这种必要的环境,
1 MIN READ
2026年 9月 4日
前沿推理触手可及:如何在 NVIDIA Jetson 上部署和优化模型
在边缘运行推理和代理式 AI 比以往更加困难。直到最近,能够进行多步骤推理的模型还过于庞大,无法在边缘硬件上本地运行。
3 MIN READ
2026年 9月 3日
如何在联邦 Kubernetes 和 AI 平台上携带用户身份
现代 AI 平台不再是单一登录屏幕背后的单一应用。用户可以从中央门户开始,打开受治理的数据集,启动数据所在的 Notebook,
2 MIN READ
2026年 9月 3日
NVIDIA PAIR 虚拟推理路由器可扩展您本地网络中的可用算力
AI 智能体正在通过合作学习做更多事情。首席智能体可以将复杂的任务分解为较小的作业,并将这些作业分配给专门的子智能体。此外,
2 MIN READ
2026年 9月 2日
现代 CUDA 工具箱的实际应用:分步优化演练
NVIDIA CUDA 仍然是 GPU 加速计算的基础,为从科学模拟到大规模 AI 训练的一切提供支持。 但是,编写正确、
7 MIN READ
2026年 9月 2日
使用预测解码共同设计 AI 模型,加快 LLM 推理速度
本文是关于 AI 模型协同设计的系列文章中的第三篇。它探讨了如何使用预测性解码在保持准确性的同时加速 LLM 推理,
4 MIN READ
2026年 9月 1日
使用 NVIDIA Nemotron 构建自适应代理式网络安全系统
AI 正在改变网络安全的步伐。代理式系统可以协调工作并长期追求复杂的目标。安全团队开始在安全运营中应用智能体,但许多实施仍然依赖于现有警报、
2 MIN READ
2026年 9月 1日
如何在不超支的情况下调整 GPU 大小以实现 AI 推理和 TCO
AI 采用率的激增正在改变从聊天机器人到内容生成的方方面面。尽管如此,一个常见的痛点仍然存在:
3 MIN READ
2026年 8月 28日
借助 NVIDIA TensorRT Model Connect,在两个命令中部署从检查点到推理的开放模型
开放 AI 模型的发展速度远超以往,但将其引入本地应用仍然需要模型特定的转换、预处理、后处理和运行时代码。
2 MIN READ
2026年 8月 26日
在 NVIDIA GB300 NVL72 上使用 Qwen3.8-Flash-Next 进行代理式编码实验
阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构的预览,供开发者试验和评估。
2 MIN READ
2026年 8月 25日
CUDA Python 1.0:稳定的 API、一个基础、完整的平台访问
多年来,需要 GPU 的 Python 开发者有两种现实选择:一是充分学习 NVIDIA CUDA C++ 以编写扩展程序,
2 MIN READ
2026年 8月 24日
利用 NVIDIA DSX MaxLPS 最大化 AI 工厂的单位功耗性能
AI 工厂是功率受限的工业系统。问题不再是一个数据中心可以容纳多少个 GPU,而是每个可用兆瓦级的 GPU 可以输出多少 AI 输出。
3 MIN READ
2026年 8月 24日
NVIDIA BlueField-4 为代理式 AI 工厂提供新的 Scale-In 网络基础设施
传统的云基础设施为可预测的通用工作负载和标准接口而设计。代理式 AI 工厂连接不同的用户、代理、应用、数据源和存储系统,
1 MIN READ