随着 Muse Glimmer 的发布,Meta 回归开源生态系统。Muse Glimmer 是一个 3000 亿开放权重密集型模型,具有 12 万多个上下文窗口,专为本地 AI 代理式工作构建。
经过优化,可在一系列 NVIDIA 边缘、桌面和工作站 AI 平台上运行,在单个 GPU 上每秒可提供 2 万个 token,使始终在线的智能体能够在本地处理数据并执行复杂的多步骤工作流程。
专为长期运行的智能体而构建,而不仅仅是对话
大多数 LLM 都针对聊天进行了优化,优先考虑单轮交互和快速获得第一个 token,但代理式工作负载需要不同的方法。支撑软件项目、修改文档或管理知识库的智能体可能会在单个会话中执行多次连续工具调用,同时需要一定程度的可靠性、一致性、长上下文一致性和持续吞吐量,而聊天优先模型无法满足这些需求。
因此,它在代理式工作负载方面表现出色,这些工作负载需要可靠的指令遵循、长上下文一致性、可预测的延迟和更少的故障模式。

跨本地硬件实现隐私保护
涉及个人文件、通信、凭据和专有文档的代理式工作流需要永远不会离开机器的推理。它足够大,可以进行复杂的多步骤推理,但足够小,可以容纳在单个 NVIDIA GPU 的显存中,无需模型分片、CPU 卸载或使用外部端点。
NVIDIA Tensor Core 架构可准确加速这种计算模式,在全上下文长度下完全在设备上实现实时代理式推理。
- NVIDIA GeForce RTX 5090 D 可将 32 GB VRAM 与第五代 Tensor Core 搭配使用,将引入本地开发者设备,在设备上保留专有代码,并消除
- NVIDIA DGX Spark 将工作站级性能和企业代理式工作流引入紧凑型系统。NVIDIA NVLink 可提供对内存的高速访问,而 NVIDIA NIM 容器可将本地 Muse Glimmer 部署作为单命令操作。
- NVIDIA DGX 工作站将机架级 Blackwell Ultra 计算引入本地企业环境,适用于在不支持云推理的 Air-gap 任务或合规性框架下运营的团队。
- NVIDIAJetson将本地Muse Glimmer推理扩展到边缘,实现了机器人、工业自动化和嵌入式系统,在这些领域,网络隔离是一项艰巨的要求,每个推理决策都必须在行动点做出。
在 NVIDIA Blackwell Ultra 上优化 Muse Glimmer 性能
在 NVIDIA Blackwell Ultra 上,Muse Glimmer 在 BF16/NVF4 精度下可实现超过 20K token/秒/GPU 的吞吐量,吞吐量-交互性曲线显示,30B 稠密架构在没有 MoE 模型路由开销的情况下仍能保持高并发。
单块 Blackwell Ultra 即可在显存中处理完整模型,并为大型 KV 缓存缓冲区预留余量,因此它非常适合开发者所需的高吞吐量和低延迟,使始终在线的智能体能够完全在本地基础设施上运行。

构建和微调智能体用例
在安全的 NVIDIA NemoClaw 环境中运行,以创建长时间运行的个人助理,助力执行代码生成、个人助理、自主支持等任务。

开发者可以使用具有高吞吐量效率的 NVIDIA NeMo AutoModel 进一步对模型进行后期训练,这是一个微调库,用于原生 Hugging Face 检查点支持,无需模型转换要求。
它支持开箱即用的完整 SFT 和 LoRA 微调,并针对 NVIDIA GPU (包括 DGX Spark) 上的快速实验进行了优化。开发者还可以使用 NeMo RL 执行强化学习,包括示例方案和参考准确性验证曲线。
适用于的灵活部署
NVIDIA 支持多个推理堆栈,可满足开发者的各种需求。
SGLang 和 vLLM 为需要在 NVIDIA 加速平台上更深入地控制性能的开发者提供开源推理方案。
它还可作为可下载的 NVIDIA NIM 提供,这是一个经过优化的预构建推理容器,可自动选择运行时配置和服务设置,因此团队可以专注于构建和扩展智能体。
开始使用和本地 AI 智能体
要开始使用,请从HuggingFace下载Muse Glimmer权重,并使用上述推理方法进行部署,或者在任何NVIDIA GPU加速平台上为生产就绪型容器提取可下载的NIM。要立即调用托管端点,请在build.nvidia.com上试用。如需在Jetson上进行边缘部署,请探索Jetson AI实验室。