Posts by Ritika Borkar
数据中心/云端
2026年 7月 31日
共同设计 AI 模型注意力,实现快速的交互式长上下文推理
随着代理式和长上下文工作负载变得常见,上下文长度增加,注意力消耗更大比例的推理时间 (图 1) 。由于注意力现在主宰了成本,
6 MIN READ
数据中心/云端
2026年 7月 10日
AI 模型协同设计:硬件友好型 LLM 设计
AI 性能可归结为三个维度: 部署必须平衡这三者:如果响应速度缓慢,就会浪费高准确度;如果每个用户的体验滞后,则原始吞吐量就意味着微不足道。
5 MIN READ
AI 平台/部署
2025年 6月 6日
NVIDIA GB200 NVL72 和 NVIDIA Dynamo 如何提升 MoE 模型的推理性能
最新一批开源大语言模型 (LLMs) 采用了 Mixture of Experts (MoE) 架构,如 DeepSeek R1、
4 MIN READ