网络安全

使用 NVIDIA Nemotron 构建自适应代理式网络安全系统

NVIDIA 与 CrowdStrike 结合了 Nemotron 开放模型、Falcon 遥测数据及专用智能体框架,构建了一套“验证优先”的攻防智能体系统。

AI 正在改变网络安全的步伐。代理式系统可以协调工作并长期追求复杂的目标。安全团队开始在安全运营中应用智能体,但许多实施仍然依赖于现有警报、预定义工作流和已知的攻击行为。更棘手的问题是确定防御系统遗漏了哪些方面,并将这些差距转化为可靠的报道。这需要在组织的独特环境中反复测试自适应攻击,并针对正常的企业活动验证候选检测。

持续的进攻 – 防御测试创造了这种反馈循环。受控攻击会产生遥测和真值防御代理所需的数据,以揭示漏洞、提高覆盖率并进行重新测试。但是,端到端周期仍然需要大量的人工操作。由开放模型和专用线束驱动的红色和蓝色智能体能否以机器速度和规模运行此循环?

NVIDIA 和 CrowdStrike 在基于 NVIDIA 加速计算基础设施 的隔离环境中评估了代理式攻击防御系统。在防御方面,为网络安全定制的 NVIDIA Nemotron 模型在 CrowdStrike SafeMind (其代理式网络安全系统) 中运行。CrowdStrike 报告称,在 CrowdStrike 内部评估中,其 Blue Solano 防御模型比经过测试的领先专有前沿模型更准确,成本降低了 99%。在此次评估中,优化的开放模型配置将用于防御编排的 NVIDIA Nemotron 3 Ultra 与用于生成检测的微调型 Nemotron 3 Super 搭配使用。

本文将分享 Nemotron 模型和专用智能体如何与 CrowdStrike 的代理式系统协同工作、如何部署和评估该系统,以及由此产生的检测结果如何在独立种子攻击运行时执行。

将进攻和防御转化为持续学习循环 

传统的红蓝团队练习依赖于人工交接:红色团队执行攻击,蓝色团队审查生成的遥测数据,检测工程师开发或更新检测结果,红色团队重新测试这些结果。每次交接都需要时间,这限制了团队可以评估的迭代次数和攻击变体。进攻性防御代理式系统将这些活动连接成可重复的闭环,以机器速度运行。在独立的代表性环境中,每次运行都会生成攻击追踪和传感器遥测数据,用于创建或完善检测结果。生成的上下文返回到红色代理束,该束会调整和测试其他攻击或规避路径,直到在代表性环境中找不到进一步的可行路线。

工作流包含四个相互关联的阶段:

  1. 执行和捕获。从威胁感知目标开始,红色智能体利用在具有代表性的环境中选择并执行攻击路径。其动作追踪记录了每个步骤,而 CrowdStrike Falcon 端点传感器则捕获了相应的遥测数据。
  2. 处理和重建。然后,Blue-agent 工具会接收动作追踪、传感器遥测和更广泛的攻击上下文。利用有关可用数据源的信息和 CrowdStrike 检测工程专业知识作为基础环境,它确定了可以重建事件序列的哪些部分、触发了哪些现有检测,以及仍然存在可见性或检测差距的位置。
  3. 生成和验证。基于此分析,Blue-agent 线束生成了候选检测结果。验证工具会检查每个候选项,根据捕获的遥测数据对其进行回测,返回故障以进行纠正,并将验证的检测结果发送到检测引擎。
  4. 重新测试、适应和重复。在部署经过验证的检测结果后,独立的种子攻击重新测试了同一目标。检测和警报上下文返回到红色代理工具中,该工具调整并探索了其他攻击或规避路径,为蓝色代理工具生成了新的追踪和遥测数据。

每个循环都旨在加强防御范围,同时迫使进攻方在完全了解防御的情况下找到一条更艰难的路线。循环会一直持续,直到建模环境中没有其他可行路径为止。

构建具有代表性的测试环境

为了实现安全、逼真的测试,NVIDIA 提供了一个经过清理的自然语言规范,代表其加速计算基础设施。智能体辅助工作流将该规范转换为隔离的目标网络智能体环境,该环境配备了 Falcon 平台传感器。

该评估使用攻击路径和可观察到的里程碑来衡量动作追踪和传感器遥测的进展,而不是智能体自己的说法。NVIDIA 安全专家审查了环境和威胁路径,以实现逼真效果。同一审查环境为每个攻击运行、检测测试和评估指标提供支持,从而实现跨配置的一致比较。

专门设计防御线束

下一个挑战是将由此产生的攻击追踪和遥测转化为可以通过技术和行为验证的检测规则。开放智能体已提供规划、工具使用、上下文管理和迭代校正等功能。开放安全 AI 联盟正在帮助扩展更广泛的开放模型、工具和网络安全工具生态系统。

防御线束结合了六种机制:

  1. 架构知识库。工具允许智能体列举受支持的 Falcon 传感器模式、字段和查询语法,从而防止发明字段和无效查询。
  2. 遥测接地。Red-agent 追踪、Falcon 遥测和更广泛的攻击上下文将工作流固定在观察到的事件和关系中,减少了不支持或幻觉的联系。
  3. 专门的检测创作。定制的 Nemotron 3 Super 可充当生成和修复检测的边界专家,将这项专业任务与更长的编排上下文分开。
  4. 伪影装饰。自动检查拒绝的语法错误、不受支持的字段,以及与特定 IP 地址、主机、用户或子网关联的检测。故障返回的指导是围绕行为信号而不是特定于环境的字符串重写检测。
  5. 检测回放。系统会根据捕获的攻击遥测数据对每个候选项进行回放。未产生匹配结果的检测被拒绝并返回进行更正,捕获看似有效但未能检测到记录活动的候选项。
  6. 独立审查。另一位具备新背景的评委则评估了每一次检测的行为对齐、稳健性和对多个信号的适当使用,发现了因皮毛和回放而漏掉的质量差距。

检查失败后,系统会将结构化反馈返回至 Blue-agent 工作流进行纠正,然后再进行一次尝试。这些机制共同编码了实践,通常通过人工检测 – 工程审查来应用,使检测生成具有基础、可测试和可修正性,而不仅仅是可信的。

自定义 Nemotron 以生成防御性编排和检测

Nemotron 等开放模型可以使用领域数据进行后训练,在受控环境中使用专有上下文进行部署,并针对成本和规模进行优化。在评估的开放模型配置中,Nemotron 3 Ultra 重建了攻击序列、计划的检测工程步骤,并调用了工具。当检测需要写入或修复时,定制的 Nemotron 3 Super 可充当边界专家。这种分离使工作流程编排不同于专门的检测创作。

为了打造这位专业的专家,CrowdStrike 使用 Nemotron 3 Super 作为其 NL2LogScale 模型的基础,然后对网络安全知识进行持续预训练、监督式微调和强化学习,并提供可验证的奖励。微调使用了 9349 个检测生成和多步骤修复示例,涵盖 59 种编程生成的错误类型。训练数据结合了对 Nemotron 3 Super 的重述请求、真实的 Falcon LogScale 执行错误,以及来自 Nemotron 3 Ultra 的经过质量审查的推理痕迹。

对于强化学习,训练工作流使用 NVIDIA NeMo Gym 在 Falcon LogScale 中验证和执行生成的查询。无效查询会收到真实的引擎错误和多达 5 次修复尝试,而未完成的尝试则会获得零奖励。有效的生成查询和参考查询会针对相同的合成日志运行,并且其返回事件之间的 F1 重叠提供了奖励。 NVIDIA NeMo RL 支持组相对策略优化,以更新模型。对于强化学习,该工作流使用 NeMo Gym 验证生成的查询,并使用 NeMo RL 根据可验证的结果更新模型。

评估从回测到实弹射击的完整智能体系统

检测可能会检测到用于制造攻击的记录攻击,但在再次执行相同行为时失败。因此,我们分两个阶段评估每个系统:针对记录的攻击进行回测,然后针对同一场景系列中的八种新攻击进行实时射击测试。每次经过的检测都会被逐字部署到实时检测引擎中。一个独立的第三方模型判断每项匹配是否代表预期的攻击行为,并对独立种子创作会话的结果求取平均值。

对记录的攻击进行回测

借助 Nemotron 3 Ultra 和默认工具,平均有 16.5% 的生成检测结果在八个独立种子会话中检测到了记录的攻击。在保留 Ultra 的同时,添加了经过调优的工具、定制的 Nemotron 3 Super、领域上下文、工具和验证,在 6 个会话中,均值提高到 41.9%,提高了 2.5 倍。由于优化的配置改变了线束和模型堆栈,因此增益反映了完整的开放工作流,而不是孤立的模型消融。

通过实火测试评估泛化

在实弹射击测试期间,针对 8 次未曾见过的攻击部署了 11 次回测通过检测 (来自由 Nemotron 提供支持的优化开放工作流) 和 35 次回测通过检测 (来自完整的前沿系统) 。在 11 个公开检测中,有 5 个 ( 45%) 至少检测到一次攻击,而 10 个前沿检测 ( 29%) 。开放的工作流平均每次检测 2.6 次,而前沿系统为 1.1 次。

然而,检测本身只是第一个质量关。为了获得“黄金级”的资格,检测还必须在可用的测试流量上保持安静,并通过行为基础、多个信号和无特定环境字符串的独立审查。在 5 次公开探测中,有 4 次探测到射击,在 10 次边界探测中,有 9 次探测到射击,但仍然保持安静,分别覆盖了 8 次攻击中的 8 次和 8 次攻击中的 7 次。经过审查,三次公开检测和无前沿检测均符合黄金标准。三次公开检测仍然涵盖了所有八次攻击。

解释结果

前沿系统产生了更多的回测通过检测结果,但经过优化的 Nemotron 开放模型工作流产生了更高的比例,使每次检测的检测结果得到泛化和平均值,并且是唯一产生黄金检测结果的系统。评估涵盖一个场景系列和小型检测集,因此跨场景泛化仍未得到测试。有限的良性流量还意味着噪音测试并不代表生产误报性能。在 8 次实弹射击中,有 3 次发生了线束故障,但生成了完整的遥测数据,并得到保留。研究结果是定向系统级案例研究,而非通用基准。

将该模式应用于专业智能体

该评估展示了使用 NVIDIA Nemotron 构建专业智能体的更广泛模式:推理模型协调防御性工作流程,后训练开放模型处理有界专家任务,智能体利用管理上下文、工具和验证。出现了四个设计原则:

  • 定义可测量的任务,并为每个模型分配明确的责任。
  • 使用领域数据和可验证的奖励对专用模型进行后训练。
  • 在权威环境中找到输出结果,并通过确定性检查、真实回放和独立审查对其进行验证。
  • 在安全专家控制场景、护栏和使用经过验证的输出的情况下,在真实条件下评估整个工作流程。

CrowdStrike 正在通过其代理式网络安全系统 NVIDIA Nemotron 3NeMo Megatron BridgeNeMo GymNeMo RL 推进这一方法,该系统将进攻性和防御性 AI 整合在一个持续的共同进化循环中。探索 NVIDIA Nemotron 3NeMo Megatron BridgeNeMo GymNeMo RL,为其他边界域自定义和评估专用智能体。

标签