Posts by Farshad Ghodsian
精选
2026年 7月 21日
在 NVIDIA GB300 NVL72 上进行 MoE 预训练创下世界纪录
前沿模型预训练已融合多专家模型 (MoE) ,这从根本上改变了对大规模 AI 训练的限制。随着每 token 的计算量下降,
3 MIN READ
精选
2026年 7月 21日
深入了解 NVIDIA Rubin GPU 架构:助力代理式 AI 时代
最初是离散 AI 模型训练和面向人类的聊天界面,后来演变为始终在线的 AI 工厂,致力于大规模生产智能。现在,
4 MIN READ
精选
2026年 7月 7日
NVIDIA Vera CPU 提升 AI 工厂吞吐量,加速代理式工作负载
代理式系统通过结合推理、工具使用、代码执行、检索、编排和结果处理的多步骤工作流,将模型推理转化为行动。随着这些系统在整个 AI 工厂中的扩展,
2 MIN READ
数据中心/云端
2026年 7月 6日
使用 Noniform Tensor Parallelism 提高大规模 LLM 训练的效率
大规模训练 LLM 会带来独特的基础架构挑战,尤其是在作业跨越数千个 GPU 并长时间运行的情况下。这些作业运行的时间越长,
2 MIN READ
精选
2026年 6月 16日
NVIDIA Blackwell 凭借业界领先的规模和性能超越 MLPerf 训练 6.0
NVIDIA 对 MLPerf Training v6.0 进行了彻底的测试,这是 MLCommons 联盟开发的最新版行业标准 AI…
3 MIN READ
数据中心/云端
2025年 11月 10日
在 NVIDIA NCCL 2.28 中使用新的 Device API 和基于拷贝引擎的集合通信实现通信和计算的融合
NVIDIA 集合通信库(NCCL)的最新版本引入了突破性的通信与计算融合技术,可显著提升多 GPU 和多节点系统中的通信吞吐量,降低延迟,
3 MIN READ