数据中心/云端
2026年 9月 3日
如何在联邦 Kubernetes 和 AI 平台上携带用户身份
现代 AI 平台不再是单一登录屏幕背后的单一应用。用户可以从中央门户开始,打开受治理的数据集,启动数据所在的 Notebook,
2 MIN READ
2026年 9月 2日
使用预测解码共同设计 AI 模型,加快 LLM 推理速度
本文是关于 AI 模型协同设计的系列文章中的第三篇。它探讨了如何使用预测性解码在保持准确性的同时加速 LLM 推理,
4 MIN READ
2026年 9月 1日
如何在不超支的情况下调整 GPU 大小以实现 AI 推理和 TCO
AI 采用率的激增正在改变从聊天机器人到内容生成的方方面面。尽管如此,一个常见的痛点仍然存在:
3 MIN READ
2026年 8月 28日
借助 NVIDIA TensorRT Model Connect,在两个命令中部署从检查点到推理的开放模型
开放 AI 模型的发展速度远超以往,但将其引入本地应用仍然需要模型特定的转换、预处理、后处理和运行时代码。
2 MIN READ
2026年 8月 24日
十亿瓦级 AI 和以太网演进:Spectrum-X 以太网如何重塑规则
生成式 AI 的迅猛发展从根本上改变了数据中心的设计。随着分布式模型训练的规模扩展到数十万个 GPU,
3 MIN READ
2026年 8月 24日
NVIDIA Vera Rubin 和 Blackwell 为代理式 AI 每瓦性能设定新标准
AI 智能体已将推理从单轮交互扩展到多步骤工作流,这些工作流能够进行推理、调用工具、协调子智能体,
3 MIN READ
2026年 8月 24日
利用 NVIDIA DSX MaxLPS 最大化 AI 工厂的单位功耗性能
AI 工厂是功率受限的工业系统。问题不再是一个数据中心可以容纳多少个 GPU,而是每个可用兆瓦级的 GPU 可以输出多少 AI 输出。
3 MIN READ
2026年 8月 24日
NVIDIA BlueField-4 为代理式 AI 工厂提供新的 Scale-In 网络基础设施
传统的云基础设施为可预测的通用工作负载和标准接口而设计。代理式 AI 工厂连接不同的用户、代理、应用、数据源和存储系统,
1 MIN READ
2026年 8月 24日
利用 NVIDIA Vera CPU 应对智能体 AI 集群面临的挑战
AI 工厂是互联系统,其中集群经济性取决于整个堆栈将电力和资本转化为已完成智能体任务的效率。GPU 运行模型时,CPU 会处理编排、
2 MIN READ
2026年 8月 24日
NVIDIA Groq 3 LPX 如何在 NVIDIA Vera Rubin 上实现长上下文的超快交互性
NVIDIA Groq 3 LPX 是适用于 NVIDIA Vera Rubin 平台 的交互式 AI 推理加速器。
4 MIN READ
2026年 8月 20日
生成式推荐系统如何大规模重新定义 RecSys
推荐系统 (RecSys) 是消费互联网行业最常见的机器学习问题之一,但众所周知,很难进行大规模训练和服务。
3 MIN READ
2026年 8月 18日
使用多个 GPU 在几分钟内运行大规模 UMAP,且不会降低准确性
统一流形近似与投影 (UMAP) 是一种广泛用于可视化和特征提取的降维技术。其应用范围涵盖探索性数据分析、主题建模和单细胞分析。
4 MIN READ
2026年 8月 12日
如何为 NVIDIA AI 工厂选择全栈可观察性
AI 基础架构跨越多个层,从计算和网络到存储、编排和应用。当性能下降时,识别来源可能很困难,因为在某一层观察到的症状可能源于堆栈中的其他地方。
3 MIN READ
2026年 8月 10日
在 NVIDIA 上使用 Meta 的运行本地代理式 AI
随着 Muse Glimmer 的发布,Meta 回归开源生态系统。Muse Glimmer 是一个 3000 亿开放权重密集型模型,
2 MIN READ
2026年 8月 3日
如何在共享 GPU 基础架构上运行隔离的租户 Kubernetes 集群
每个团队运行专用的 Kubernetes 集群通常会导致隔离程度超出组织所需的程度。虽然一个集群可以在多个团队之间成功共享,
4 MIN READ
2026年 8月 3日
NVIDIA Vera 存储基准测试:加速 AI 原生存储的加密、压缩、完整性检查和恢复
存储是每个代理式 AI 工作流中不可或缺的组成部分。当智能体检索企业知识、访问持久内存、重用键值 (KV) 缓存数据、执行工具并生成新结果时,
3 MIN READ