Posts by Bita Darvish Rouhani
数据中心/云端
2026年 7月 10日
AI 模型协同设计:硬件友好型 LLM 设计
AI 性能可归结为三个维度: 部署必须平衡这三者:如果响应速度缓慢,就会浪费高准确度;如果每个用户的体验滞后,则原始吞吐量就意味着微不足道。
5 MIN READ
数据科学
2025年 7月 7日
提出一个维基百科规模的问题:如何利用数百万 token 的实时推理使世界更加智能
现代 AI 应用越来越依赖于将庞大的参数数量与数百万个令牌的上下文窗口相结合的模型。无论是经过数月对话的 AI 智能体、
3 MIN READ
AI 平台/部署
2025年 6月 6日
NVIDIA GB200 NVL72 和 NVIDIA Dynamo 如何提升 MoE 模型的推理性能
最新一批开源大语言模型 (LLMs) 采用了 Mixture of Experts (MoE) 架构,如 DeepSeek R1、
4 MIN READ