多专家模型 (MoE)
2026年 7月 21日
在 NVIDIA GB300 NVL72 上进行 MoE 预训练创下世界纪录
前沿模型预训练已融合多专家模型 (MoE) ,这从根本上改变了对大规模 AI 训练的限制。随着每 token 的计算量下降,
3 MIN READ
2026年 7月 21日
深入了解 NVIDIA Rubin GPU 架构:助力代理式 AI 时代
最初是离散 AI 模型训练和面向人类的聊天界面,后来演变为始终在线的 AI 工厂,致力于大规模生产智能。现在,
4 MIN READ
2026年 7月 10日
借助主机卸载减少基于 JAX 的 LLM 训练中的高带宽内存瓶颈
在充分利用计算能力之前,大语言模型 (LLM) 训练工作负载越来越多地遇到 GPU 显存限制。模型权重、梯度、优化器状态、
3 MIN READ
2026年 6月 23日
通过全栈推理和训练优化,更大限度地提高 AI 工厂的能效
为运行 AI 工厂,电力成本可占运营支出(OpEx)的 40%。每瓦可用于开销、数据摄取、训练,或为客户生成 token。
2 MIN READ
2026年 6月 15日
借助高级融合内核提高 MoE 训练吞吐量
多专家模型 (MoE) 已迅速成为现代大规模 AI 系统的基础组件。它们之所以得到广泛采用,是因为它们能够显著提高模型容量,
2 MIN READ
2026年 6月 2日
使用 Microsoft 和 NVIDIA 的新工具在 Windows PC 上构建个人 AI 智能体
AI 智能体正在改变您与 PC 的交互方式。创作者、开发者和 AI 爱好者已经在广泛使用这些智能体来协助完成编码、
3 MIN READ
2026年 5月 21日
借助 Slurm 拓扑感知型作业调度功能,在 NVIDIA GB200 NVL72 上实现百万兆级性能
随着AI模型的规模和复杂性持续提升,要充分发挥现代加速基础设施的性能,关键在于如何合理分配工作负载以及硬件的部署方式。
3 MIN READ
2026年 4月 11日
MiniMax M2.7 在 NVIDIA 平台上推进复杂 AI 应用的可扩展代理工作流程
MiniMax M2.7 的发布为流行的 MiniMax M2.7 模型增加了增强功能,该模型专为代理式线束以及推理、ML 研究工作流程、
2 MIN READ
2026年 3月 11日
隆重推出 Nemotron 3 Super:用于代理式推理的开放式混合式 Mamba-Transformer MoE
代理式 AI 系统需要具有专业深度的模型来自主解决密集的技术问题。它们必须在推理、编码和长上下文分析方面表现出色,同时保持足够的效率,
3 MIN READ
2026年 3月 9日
从解服务中移除猜测
部署和优化大语言模型 (LLM) 以实现高性能、经济高效的服务可能是一项艰巨的工程难题。任何给定工作负载 (例如硬件、并行和预填充/
3 MIN READ
2026年 2月 27日
基于 NVIDIA GPU 加速端点,使用千问3.5 VLM 开发原生多模态智能体
阿里巴巴推出了全新开源 千问3.5 系列,专为构建原生多模态智能体而设计。该系列的首个模型是一款总参数为 397B、
1 MIN READ
2026年 2月 2日
使用混合专家并行优化混合专家训练的通信
在 LLM 训练中,超大规模多专家模型 (MoE) 的专家并行 (EP) 通信面临巨大挑战。EP 通信本质上属于多对多模式,
4 MIN READ