数据中心/云端
2026年 8月 18日
使用多个 GPU 在几分钟内运行大规模 UMAP,且不会降低准确性
统一流形近似与投影 (UMAP) 是一种广泛用于可视化和特征提取的降维技术。其应用范围涵盖探索性数据分析、主题建模和单细胞分析。
4 MIN READ
2026年 8月 12日
如何为 NVIDIA AI 工厂选择全栈可观察性
AI 基础架构跨越多个层,从计算和网络到存储、编排和应用。当性能下降时,识别来源可能很困难,因为在某一层观察到的症状可能源于堆栈中的其他地方。
3 MIN READ
2026年 8月 10日
在 NVIDIA 上使用 Meta 的运行本地代理式 AI
随着 Muse Glimmer 的发布,Meta 回归开源生态系统。Muse Glimmer 是一个 3000 亿开放权重密集型模型,
2 MIN READ
2026年 8月 3日
如何在共享 GPU 基础架构上运行隔离的租户 Kubernetes 集群
每个团队运行专用的 Kubernetes 集群通常会导致隔离程度超出组织所需的程度。虽然一个集群可以在多个团队之间成功共享,
4 MIN READ
2026年 8月 3日
NVIDIA Vera 存储基准测试:加速 AI 原生存储的加密、压缩、完整性检查和恢复
存储是每个代理式 AI 工作流中不可或缺的组成部分。当智能体检索企业知识、访问持久内存、重用键值 (KV) 缓存数据、执行工具并生成新结果时,
3 MIN READ
2026年 7月 31日
共同设计 AI 模型注意力,实现快速的交互式长上下文推理
随着代理式和长上下文工作负载变得常见,上下文长度增加,注意力消耗更大比例的推理时间 (图 1) 。由于注意力现在主宰了成本,
6 MIN READ
2026年 7月 30日
NVIDIA 示例云:释放 AI 基础设施全部性能的经验教训
由相同的 NVIDIA H100、GB200 NVL72 或 GB300 NVL72 系统构建的两个 AI…
4 MIN READ
2026年 7月 26日
推动半导体在材料工程和制造领域的创新
随着 AI 工作负载的增加,爆炸性的计算需求正在推动半导体行业达到前所未有的性能目标。在快速变化的 AI 硬件周期中,
2 MIN READ
2026年 7月 24日
ModelExpress:以光速分发模型伪影
每移动一个字节都会产生一定的成本。随着模型检查点数量增长到数百 GB 甚至一 TB,这一成本会迅速增加。更糟糕的是,
3 MIN READ
2026年 7月 21日
在 NVIDIA GB300 NVL72 上进行 MoE 预训练创下世界纪录
前沿模型预训练已融合多专家模型 (MoE) ,这从根本上改变了对大规模 AI 训练的限制。随着每 token 的计算量下降,
3 MIN READ
2026年 7月 21日
深入了解 NVIDIA Rubin GPU 架构:助力代理式 AI 时代
最初是离散 AI 模型训练和面向人类的聊天界面,后来演变为始终在线的 AI 工厂,致力于大规模生产智能。现在,
4 MIN READ
2026年 7月 21日
NVIDIA Vera CPU:专为实现代理式 AI 的最大单线程性能而打造的 Olympus Core
代理式 AI 将更多的关键执行路径转移到 CPU 上。智能体在沙盒中执行代码、调用工具、检索上下文、与数据库交互,以及分析结果,
3 MIN READ
2026年 7月 16日
借助 NVIDIA BlueField 实现极致协同设计,扩展代理式 AI 工厂
代理式 AI 改变了 AI 工厂的基础设施模式。在生成最终答案之前,一个请求可以触发多次模型调用、工具调用、内存查找、策略检查、
2 MIN READ
2026年 7月 13日
NVIDIA 正在解码,将色彩代码逻辑错误率降低超过 300 倍
实用的量子计算机需要容错逻辑运算。研究人员正在积极探索许多不同的量子纠错 (QEC) 代码来实现这一点,从而提高量子处理单元 (QPU)…
2 MIN READ
2026年 7月 10日
AI 模型协同设计:硬件友好型 LLM 设计
AI 性能可归结为三个维度: 部署必须平衡这三者:如果响应速度缓慢,就会浪费高准确度;如果每个用户的体验滞后,则原始吞吐量就意味着微不足道。
5 MIN READ
2026年 7月 6日
使用 Noniform Tensor Parallelism 提高大规模 LLM 训练的效率
大规模训练 LLM 会带来独特的基础架构挑战,尤其是在作业跨越数千个 GPU 并长时间运行的情况下。这些作业运行的时间越长,
2 MIN READ