TensorRT-LLM
2026年 9月 18日
借助 AIPerf 对 LLM 进行大规模基准测试推理
在系统上部署模型。启动后,提示得到响应。难题是:速度快吗? 直觉可能会引导您发送 curl 命令、手动滚动异步脚本或另一个一次性负载生成器。
3 MIN READ
2026年 9月 16日
TensorRT Edge-LLM 在 Jetson AGX Thor 上实现 MLPerf Edge Agentic Benchmark 6.4 倍加速
AI 智能体正从云数据中心转向车辆、机器人和其他边缘设备。与只回答单个提示的聊天机器人不同,智能体需要执行一系列步骤。它会选择工具、评估结果,
2 MIN READ
2026年 8月 24日
NVIDIA Vera Rubin 和 Blackwell 为代理式 AI 每瓦性能设定新标准
AI 智能体已将推理从单轮交互扩展到多步骤工作流,这些工作流能够进行推理、调用工具、协调子智能体,
3 MIN READ
2026年 8月 20日
生成式推荐系统如何大规模重新定义 RecSys
推荐系统 (RecSys) 是消费互联网行业最常见的机器学习问题之一,但众所周知,很难进行大规模训练和服务。
3 MIN READ
2026年 7月 31日
共同设计 AI 模型注意力,实现快速的交互式长上下文推理
随着代理式和长上下文工作负载变得常见,上下文长度增加,注意力消耗更大比例的推理时间 (图 1) 。由于注意力现在主宰了成本,
6 MIN READ
2026年 7月 10日
AI 模型协同设计:硬件友好型 LLM 设计
AI 性能可归结为三个维度: 部署必须平衡这三者:如果响应速度缓慢,就会浪费高准确度;如果每个用户的体验滞后,则原始吞吐量就意味着微不足道。
5 MIN READ
2026年 7月 2日
基于硬件的 AI 安全性不会拖慢您的速度
AI 改变了组织的运营方式,推动了前所未有的生产力和创新水平。但是,数据隐私、主权以及如何保护使用中的数据,
2 MIN READ
2026年 6月 23日
通过全栈推理和训练优化,更大限度地提高 AI 工厂的能效
为运行 AI 工厂,电力成本可占运营支出(OpEx)的 40%。每瓦可用于开销、数据摄取、训练,或为客户生成 token。
2 MIN READ
2026年 6月 23日
使用 DFlash 预测解码,在 NVIDIA Blackwell 上将推理性能提升高达 15 倍
随着 AI 系统从单轮交互转向协调的多智能体工作流,低延迟 推理 成为越来越重要。自回归 LLM 按顺序生成 token,
2 MIN READ
2026年 6月 12日
NVIDIA 在首个代理式 AI 基准测试中实现了领先的代理式编码性能
AI 智能体从根本上改变了推理工作负载的复杂性。到目前为止,业界一直在努力定义用于衡量推理系统在这些条件下的性能的标准。
2 MIN READ
2026年 6月 12日
在 NVIDIA 加速基础设施上使用 MiniMax M3 部署长上下文推理和代理式工作流
随着企业 AI 采用的规模扩大,开发者越来越多地不得不将分散的工作流拼接在一起,即分别用于文本、视觉和代码的模型,从而导致复杂性增加、
1 MIN READ
2026年 6月 9日
模型量化:借助 NVIDIA TensorRT 将 FP8 检查点转变为高性能推理引擎
将量化检查点转换为 NVIDIA TensorRT 引擎可以弥合模型优化与生产部署之间的差距,从而实现更快的推理速度、
4 MIN READ
2025年 5月 2日
借助 NVIDIA 在生产应用中集成和部署 Tongyi Qwen3 模型
阿里巴巴近期发布了其开源的混合推理大语言模型(LLM)通义千问 Qwen3,此次 Qwen3 开源模型系列包含两款混合专家模型 (MoE)…
3 MIN READ