LLMs
2026年 9月 18日
借助 AIPerf 对 LLM 进行大规模基准测试推理
在系统上部署模型。启动后,提示得到响应。难题是:速度快吗? 直觉可能会引导您发送 curl 命令、手动滚动异步脚本或另一个一次性负载生成器。
3 MIN READ
2026年 9月 15日
密集与 MoE 模型:活动参数、吞吐量以及选择每个模型的时间
一个包含 300 亿个参数的模型如何仅对每个 token 激活 300 亿个参数,同时仍然使用更大模型的容量?Nemotron 3.5…
2 MIN READ
2026年 9月 10日
从晶圆到第一个 Token:使用 Nemotron 和 Palantir Foundry 编写供应链专业知识
NVIDIA 拥有世界上最大、最复杂的供应链之一,其性能从晶圆到第一个 token 来衡量。间隔分为两部分。从芯片到机架的运行时间 (…
2 MIN READ
2026年 9月 4日
使用 NVIDIA NemoClaw 构建内存驱动型智能体
企业工作涵盖随时间变化的AI 智能体必须先对其进行重建,然后再进行贡献。 为了向智能体提供这种必要的环境,
1 MIN READ
2026年 9月 2日
使用预测解码共同设计 AI 模型,加快 LLM 推理速度
本文是关于 AI 模型协同设计的系列文章中的第三篇。它探讨了如何使用预测性解码在保持准确性的同时加速 LLM 推理,
4 MIN READ
2026年 8月 11日
借助 NVIDIA NeMo 交换机,跨模型路由 AI 智能体工作负载
构建 AI 智能体 并非以选择单个模型为终点。每个模型都有自己的长处、短处和成本曲线,这可能会从一种工作负载转移到另一种工作负载,
2 MIN READ
2026年 7月 27日
六种智能体 Harness 功能可实现更高的模型性能
构建出色的 AI 智能体不仅仅是选择合适的模型。Harness 是围绕模型的架构。渲染上下文、执行动作、管理状态以及决定任务何时完成,
2 MIN READ
2026年 7月 26日
NVIDIA Nemotron 3 Ultra 在代理式 RTL 编码的准确性和效率方面引领开放模型
现代芯片设计日益受到工程时间的限制。寄存器传输级 (RTL) 开发和验证需要具备专门的硬件知识、
3 MIN READ
2026年 7月 24日
ModelExpress:以光速分发模型伪影
每移动一个字节都会产生一定的成本。随着模型检查点数量增长到数百 GB 甚至一 TB,这一成本会迅速增加。更糟糕的是,
3 MIN READ
2026年 7月 10日
AI 模型协同设计:硬件友好型 LLM 设计
AI 性能可归结为三个维度: 部署必须平衡这三者:如果响应速度缓慢,就会浪费高准确度;如果每个用户的体验滞后,则原始吞吐量就意味着微不足道。
5 MIN READ
2026年 7月 7日
使用 NVIDIA Nemotron 构建用于工业警报管理的分析 AI 智能体
工业机械产生的警报数量超过技术人员能够进行分类的数量。对于每个需要跟进的重要警报,技术人员都会提取历史背景,确定正确的程序,
2 MIN READ
2026年 6月 9日
借助 NVIDIA DGX Spark Enterprise 可管理性,大规模控制 AI 基础设施的生命周期
随着 AI 基础设施的扩展,企业对运营成熟度的期望与日俱增。组织期望这些系统具备可配置、可观察、安全且可大规模管理的特点,
1 MIN READ
2026年 6月 4日
NVIDIA Nemotron 3 Ultra 为长时间运行的智能体提供更快、更高效的推理能力
单轮聊天机器人正在演变为长时间运行的智能体,这些智能体可以进行推理、维护上下文、使用工具,并在多轮中高效运行,从而完成复杂的工作流程。 但是,
3 MIN READ
2026年 6月 2日
使用 Microsoft 和 NVIDIA 的新工具在 Windows PC 上构建个人 AI 智能体
AI 智能体正在改变您与 PC 的交互方式。创作者、开发者和 AI 爱好者已经在广泛使用这些智能体来协助完成编码、
3 MIN READ
2026年 6月 1日
在 NVIDIA DGX Spark 上使用更快的模型和多节点集群运行本地 AI 智能体
自主、长期运行的 AI 智能体的兴起带来了一种新型计算需求,即维护大型上下文窗口、生成并发子智能体,以及在不依赖云的情况下持续迭代的任务。
2 MIN READ
2026年 5月 20日
掌握智能体技术:AI 智能体定制
自主 AI 智能体 正承担着企业中的各种任务:规划物流车队路线、分类支持工单、生成代码以及编排多步骤工作流。
3 MIN READ