精选
2026年 8月 26日
在 NVIDIA GB300 NVL72 上使用 Qwen3.8-Flash-Next 进行代理式编码实验
阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构的预览,供开发者试验和评估。
2 MIN READ
2026年 8月 24日
NVIDIA BlueField-4 为代理式 AI 工厂提供新的 Scale-In 网络基础设施
传统的云基础设施为可预测的通用工作负载和标准接口而设计。代理式 AI 工厂连接不同的用户、代理、应用、数据源和存储系统,
1 MIN READ
2026年 8月 24日
利用 NVIDIA Vera CPU 应对智能体 AI 集群面临的挑战
AI 工厂是互联系统,其中集群经济性取决于整个堆栈将电力和资本转化为已完成智能体任务的效率。GPU 运行模型时,CPU 会处理编排、
2 MIN READ
2026年 8月 21日
NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示了适用于长距自动驾驶智能体的前沿通用架构
前沿语言模型只是 AI 智能体 的一个组成部分。周围的智能体系统——通常称为线束——决定了模型如何接收上下文、使用工具、维护状态、响应反馈、
2 MIN READ
2026年 8月 12日
在 NVIDIA GB300 NVL72 上部署参数量达 2.4T 的 Qwen3.8-2.4T-A95B 模型,并支持可配置推理
阿里巴巴发布了其最大的开放权重模型 Qwen3.8-2.4 T-A95B (Qwen3.8-Max) 的开放权重,
2 MIN READ
2026年 8月 11日
NVIDIA Nemotron 3.5 Lightning 为长期运行的智能体提供快速、准确的专业任务执行
长期运行的 AI 智能体将大部分时间用于大量执行:工具调用、结果验证和子智能体委托。在每个执行步骤中使用前沿推理模型会增加成本和延迟。
2 MIN READ
2026年 8月 11日
借助 NVIDIA NeMo 交换机,跨模型路由 AI 智能体工作负载
构建 AI 智能体 并非以选择单个模型为终点。每个模型都有自己的长处、短处和成本曲线,这可能会从一种工作负载转移到另一种工作负载,
2 MIN READ
2026年 8月 10日
在 NVIDIA 上使用 Meta 的运行本地代理式 AI
随着 Muse Glimmer 的发布,Meta 回归开源生态系统。Muse Glimmer 是一个 3000 亿开放权重密集型模型,
2 MIN READ
2026年 8月 4日
使用 NVIDIA Alpamayo 2 Super 生成轨迹、推理路径和自动标注
辅助驾驶开发通常依赖多个相互独立的模型,分别用于轨迹生成、高层级意图预测、场景理解以及数据标注。这种分开的方式使得相关结果难以直接比较,
5 MIN READ
2026年 7月 27日
六种智能体 Harness 功能可实现更高的模型性能
构建出色的 AI 智能体不仅仅是选择合适的模型。Harness 是围绕模型的架构。渲染上下文、执行动作、管理状态以及决定任务何时完成,
2 MIN READ
2026年 7月 21日
在 NVIDIA GB300 NVL72 上进行 MoE 预训练创下世界纪录
前沿模型预训练已融合多专家模型 (MoE) ,这从根本上改变了对大规模 AI 训练的限制。随着每 token 的计算量下降,
3 MIN READ
2026年 7月 21日
深入了解 NVIDIA Rubin GPU 架构:助力代理式 AI 时代
最初是离散 AI 模型训练和面向人类的聊天界面,后来演变为始终在线的 AI 工厂,致力于大规模生产智能。现在,
4 MIN READ
2026年 7月 21日
NVIDIA Vera CPU:专为实现代理式 AI 的最大单线程性能而打造的 Olympus Core
代理式 AI 将更多的关键执行路径转移到 CPU 上。智能体在沙盒中执行代码、调用工具、检索上下文、与数据库交互,以及分析结果,
3 MIN READ
2026年 7月 8日
为 NVIDIA Nemotron 3 Ultra 创建 LangChain 深度智能体线束配置文件以提高性能
代理式系统通常需要在准确性和成本之间做出权衡。性能最高的专有前沿模型和线束可提供最高的准确性,但成本高昂。微调是解决这一问题的一种方法。
3 MIN READ
2026年 7月 7日
NVIDIA Vera CPU 提升 AI 工厂吞吐量,加速代理式工作负载
代理式系统通过结合推理、工具使用、代码执行、检索、编排和结果处理的多步骤工作流,将模型推理转化为行动。随着这些系统在整个 AI 工厂中的扩展,
2 MIN READ
2026年 6月 23日
使用 DFlash 预测解码,在 NVIDIA Blackwell 上将推理性能提升高达 15 倍
随着 AI 系统从单轮交互转向协调的多智能体工作流,低延迟 推理 成为越来越重要。自回归 LLM 按顺序生成 token,
2 MIN READ