AI 推理
2026年 9月 22日
借助 NVIDIA 机密计算实现私有高性能生产级 AI 推理
随着大语言模型 (LLM) 推理越来越多地在个人、企业和受监管环境中处理敏感信息和专有模型上下文,数据必须在可信环境中处理。
2 MIN READ
2026年 9月 21日
借助 NVIDIA Dynamo-Triton 中的 NVIDIA TensorRT 多设备集成,简化跨多个 GPU 的模型服务
生成式 AI 对计算和内存的需求日益超出单个 GPU 的能力。NVIDIA TensorRT 多设备推理是一项新功能,
3 MIN READ
2026年 9月 18日
借助 AIPerf 对 LLM 进行大规模基准测试推理
在系统上部署模型。启动后,提示得到响应。难题是:速度快吗? 直觉可能会引导您发送 curl 命令、手动滚动异步脚本或另一个一次性负载生成器。
3 MIN READ
2026年 9月 16日
TensorRT Edge-LLM 在 Jetson AGX Thor 上实现 MLPerf Edge Agentic Benchmark 6.4 倍加速
AI 智能体正从云数据中心转向车辆、机器人和其他边缘设备。与只回答单个提示的聊天机器人不同,智能体需要执行一系列步骤。它会选择工具、评估结果,
2 MIN READ
2026年 9月 15日
密集与 MoE 模型:活动参数、吞吐量以及选择每个模型的时间
一个包含 300 亿个参数的模型如何仅对每个 token 激活 300 亿个参数,同时仍然使用更大模型的容量?Nemotron 3.5…
2 MIN READ
2026年 9月 15日
NVIDIA Groq 3 LPX 确定性执行如何在 NVIDIA Vera Rubin 上推动节能高效的高交互性推理
功率是 AI 工厂 的决定性限制。由于 AI 工作负载需要一个完整的计算平台来为其提供服务,
2 MIN READ
2026年 9月 9日
何时使用“编码-预填充-解码”解耦技术来加速多模态模型服务
编码 – 预填充 – 解码 (EPD) 分解是一种适用于多模态模型的推理优化技术,可将视觉编码器阶段与预填充和解码阶段分离开来。
4 MIN READ
2026年 9月 3日
NVIDIA PAIR 虚拟推理路由器可扩展您本地网络中的可用算力
AI 智能体正在通过合作学习做更多事情。首席智能体可以将复杂的任务分解为较小的作业,并将这些作业分配给专门的子智能体。此外,
2 MIN READ
2026年 9月 2日
使用预测解码共同设计 AI 模型,加快 LLM 推理速度
本文是关于 AI 模型协同设计的系列文章中的第三篇。它探讨了如何使用预测性解码在保持准确性的同时加速 LLM 推理,
4 MIN READ
2026年 9月 1日
如何在不超支的情况下调整 GPU 大小以实现 AI 推理和 TCO
AI 采用率的激增正在改变从聊天机器人到内容生成的方方面面。尽管如此,一个常见的痛点仍然存在:
3 MIN READ
2026年 8月 28日
借助 NVIDIA TensorRT Model Connect,在两个命令中部署从检查点到推理的开放模型
开放 AI 模型的发展速度远超以往,但将其引入本地应用仍然需要模型特定的转换、预处理、后处理和运行时代码。
2 MIN READ
2026年 8月 24日
利用 NVIDIA DSX MaxLPS 最大化 AI 工厂的单位功耗性能
AI 工厂是功率受限的工业系统。问题不再是一个数据中心可以容纳多少个 GPU,而是每个可用兆瓦级的 GPU 可以输出多少 AI 输出。
3 MIN READ
2026年 8月 24日
NVIDIA Groq 3 LPX 如何在 NVIDIA Vera Rubin 上实现长上下文的超快交互性
NVIDIA Groq 3 LPX 是适用于 NVIDIA Vera Rubin 平台 的交互式 AI 推理加速器。
4 MIN READ
2026年 8月 20日
生成式推荐系统如何大规模重新定义 RecSys
推荐系统 (RecSys) 是消费互联网行业最常见的机器学习问题之一,但众所周知,很难进行大规模训练和服务。
3 MIN READ
2026年 8月 11日
NVIDIA JetPack 7.2.1 新增代理式视频技能和 T3000 仿真
从机器人和智能视频分析到工业自动化、医疗健康、媒体处理和远程操作,视频是 NVIDIA Jetson 应用的核心数据路径。
2 MIN READ
2026年 7月 31日
共同设计 AI 模型注意力,实现快速的交互式长上下文推理
随着代理式和长上下文工作负载变得常见,上下文长度增加,注意力消耗更大比例的推理时间 (图 1) 。由于注意力现在主宰了成本,
6 MIN READ