TensorRT
2026年 7月 10日
AI 模型协同设计:硬件友好型 LLM 设计
AI 性能可归结为三个维度: 部署必须平衡这三者:如果响应速度缓慢,就会浪费高准确度;如果每个用户的体验滞后,则原始吞吐量就意味着微不足道。
5 MIN READ
2026年 7月 10日
借助 NVIDIA BioNeMo Agent Toolkit 加速端到端协同折叠性能
生物分子结构预测以及与 OpenFold3 等模型的联合折叠现已成为主流的大规模工作负载,为药物研发和蛋白质设计提供支持。
3 MIN READ
2026年 7月 2日
基于硬件的 AI 安全性不会拖慢您的速度
AI 改变了组织的运营方式,推动了前所未有的生产力和创新水平。但是,数据隐私、主权以及如何保护使用中的数据,
2 MIN READ
2026年 6月 25日
使用 NVIDIA TensorRT 和多设备推理支持,跨多个 GPU 扩展 AI 推理
生成式 AI 工作负载的显存和计算预算正迅速超出单个 GPU。对于构建媒体生成工作流的推理开发者而言,
4 MIN READ
2026年 6月 24日
加速 NVIDIA GPU 上用于物理 AI 应用的 BEV 池化
鸟瞰图 (BEV) 感知是智能汽车 (智能汽车) 、机器人和空间 AI 系统日益常见的设计模式。
5 MIN READ
2026年 6月 23日
通过全栈推理和训练优化,更大限度地提高 AI 工厂的能效
为运行 AI 工厂,电力成本可占运营支出(OpEx)的 40%。每瓦可用于开销、数据摄取、训练,或为客户生成 token。
2 MIN READ
2026年 6月 23日
使用 DFlash 预测解码,在 NVIDIA Blackwell 上将推理性能提升高达 15 倍
随着 AI 系统从单轮交互转向协调的多智能体工作流,低延迟 推理 成为越来越重要。自回归 LLM 按顺序生成 token,
2 MIN READ
2026年 6月 22日
借助 DAQIRI 实现用于高速数据采集的实时 AI
当 AlphaFold2 在 2020 年彻底改变药物研发时,
3 MIN READ
2026年 6月 12日
NVIDIA 在首个代理式 AI 基准测试中实现了领先的代理式编码性能
AI 智能体从根本上改变了推理工作负载的复杂性。到目前为止,业界一直在努力定义用于衡量推理系统在这些条件下的性能的标准。
2 MIN READ
2026年 6月 12日
在 NVIDIA 加速基础设施上使用 MiniMax M3 部署长上下文推理和代理式工作流
随着企业 AI 采用的规模扩大,开发者越来越多地不得不将分散的工作流拼接在一起,即分别用于文本、视觉和代码的模型,从而导致复杂性增加、
1 MIN READ
2026年 6月 9日
模型量化:借助 NVIDIA TensorRT 将 FP8 检查点转变为高性能推理引擎
将量化检查点转换为 NVIDIA TensorRT 引擎可以弥合模型优化与生产部署之间的差距,从而实现更快的推理速度、
4 MIN READ
2026年 6月 2日
使用 Microsoft 和 NVIDIA 的新工具在 Windows PC 上构建个人 AI 智能体
AI 智能体正在改变您与 PC 的交互方式。创作者、开发者和 AI 爱好者已经在广泛使用这些智能体来协助完成编码、
3 MIN READ
2025年 5月 2日
借助 NVIDIA 在生产应用中集成和部署 Tongyi Qwen3 模型
阿里巴巴近期发布了其开源的混合推理大语言模型(LLM)通义千问 Qwen3,此次 Qwen3 开源模型系列包含两款混合专家模型 (MoE)…
3 MIN READ
2024年 7月 24日
借助最新 NVIDIA Merlin TensorFlow 插件实现大规模 Embedding 扩展
通过封装 NVIDIA Merlin HugeCTR,Sparse Operation Kit(以下简称 SOK)使得…
4 MIN READ
2024年 6月 11日
借助 NVIDIA TensorRT 轻量级引擎,为 AI 应用提供卓越性能和最小占用空间
NVIDIA TensorRT一个成熟的数据中心推理库,已迅速成为 NVIDIA GeForce RTX 和 NVIDIA RTX GPU…
2 MIN READ
2024年 6月 3日
NVIDIA 与 Hugging Face 合作,简化生成式 AI 模型部署
随着生成式 AI 的快速增长,社区通过两种重要方式加强了这种扩展:快速发布先进的基础模型,以及简化其与应用程序开发和生产的集成。
2 MIN READ