当前位置: 首页 » 资讯 » 新科技 » 正文

AI能挖漏洞吗?北航等机构把真实漏洞炼进了模型参数

IP属地 中国·北京 机器之心Pro 时间:2026-09-01 20:06:51



给一个大模型漏洞描述和代码仓库,它能否像安全研究人员一样,读代码、找入口、调用工具、构造输入,并反复验证自己的判断?

这已经不只是问答能力的问题。真正的网络安全任务往往要持续数十分钟甚至更久,模型需要在真实环境中完成搜索、编译、运行、分析和修正。决定成败的,不只是模型 “知道多少”,还包括它能否把一连串操作组织起来。

现有开源方案仍有几处彼此关联的缺口:

一些前沿模型虽然开放权重,却没有开源可复现的网络安全训练流程;已有解决方案通常只解决单项任务,尚未形成统一方案;已有解决方案缺乏可规模化的智能体数据;规模化合成智能体数据需要安全相关的先验知识。

来自北京航空航天大学、欧洲学习与智能系统研究院(ELLIS)、新加坡管理大学(SMU)和至知创新研究院(IQuest Research)的研究团队提出了CyberFactory,并在此基础上训练出开源网络安全模型OpenAegis。这项工作的重点并不是再收集一批静态题目,而是补上从真实漏洞到智能体训练轨迹的整条链路。



CyberFactory 把公开世界中零散的漏洞材料重建为能运行、能判定的任务,再用一套安全分析 Skill 引导智能体完成任务、留下操作轨迹,最终把这些做事方法训练进OpenAegis。最终评测限时 1 小时。在这个条件下,与 Qwen3.5 基座相比,OpenAegis 的通过率从 29.6% 提升到 58.1%,领先 GLM 5.2 14.8 个百分点,领先 Kimi K2.7 6.4 个百分点。



论文标题:CyberFactory: Scaling Cyber Security Capabilities with Instances from the WildHugging Face:https://huggingface.co/collections/Multilingual-Multimodal-NLP/cyberfactoryGitHub:https://github.com/CSJianYang/CyberFactory

两个关键突破:

先造出轨迹,再让模型学会方法

这项工作围绕两个过去没有被同时解决的问题展开。

第一,真实漏洞资料并不等于训练数据。开源 CVE 记录通常只有漏洞说明、修复提交和少量崩溃信息。要让智能体真正动手解决问题,还需要补齐受影响的代码版本、修复后的版本、编译环境、运行入口以及自动判定程序。

第二,即使任务环境准备好了,现有开源模型也未必能稳定完成任务。安全研究不是一次作答,而是一个不断提出猜想、调用工具、检查结果、再改变策略的过程。如果智能体频繁在无关方向上试错,就很难批量获得可用的训练轨迹。

CyberFactory 分别给出了对应的办法:

一套统一、开放且可复现的训练流程:把零散的漏洞材料整理为可执行、可自动判定的任务,连接数据构造、轨迹生成和模型训练,并覆盖漏洞复现输入生成、漏洞修复和网络安全问答。一套可扩展的智能体数据生成方法:用可复用的通用漏洞分析作为 Skills 提供领域方法,再通过工具交互、环境反馈和自动判定获得高质量轨迹。

前者解决 “题从哪里来”,后者解决 “高质量解题过程怎样来”。两者结合后,团队得到的不是普通问答对,而是包含代码检索、工具调用、编译运行、失败分析和结果验证在内的完整智能体轨迹。

这也是 OpenAegis 与许多既有网络安全模型最重要的区别:它学习的不只是漏洞知识和最终答案,还学习了安全研究任务中的连续行动过程。

CyberFactory 补上的不只是一批训练材料,而是一条能够从开源漏洞持续构造任务、生成轨迹并训练模型的完整路径。

题从哪里来?

从开源漏洞到可训练任务

真实世界中的漏洞材料来源复杂,完整程度也不相同。CyberFactory 使用了 ARVO、OSS-Fuzz 和开源 CVE 等多类来源。

其中,开源 CVE 最难处理。一个常见条目可能只给出修复提交、漏洞类型和简短说明,却没有现成的运行环境。团队为此设计了三步处理流程。

第一步:重建漏洞前后的程序环境

系统从多个来源获取源码仓库、定位修复提交、构造验证文件,根据修复提交提取漏洞版本和修复版本,分别构建可运行环境。这样,同一个候选输入可以在修复前后各运行一次。

第二步:确认任务确实可解,并控制难度

系统将实际运行获取的证据与已有公开的漏洞类型、崩溃报告和崩溃位置等作检验校准,这样留下来的任务具有可核验的漏洞依据。而后剔除冗余,同时不会把验证阶段使用的额外线索泄露给训练模型。

第三步:生成适合智能体使用的任务说明

对于说明完整的修复提交,系统直接保留其中的有效信息;对于说明含糊的条目,则结合可用的漏洞证据和修复内容生成任务描述。用于任务核验和筛选的额外线索不会交给轨迹生成或模型训练,以免泄露答案。

经过这几步,原本散落在漏洞库、代码仓库和构建记录中的材料,才真正变成一个可以交给智能体处理的任务。



高质量解题过程怎样来?

规定分析流程,而不是提供具体答案

任务实例规定了模型要解决什么问题,却没有规定模型应当怎样处理。直接生成轨迹时,模型可能把大量时间花在临时构造输入或重复尝试上,缺少稳定的分析流程。

为此,CyberFactory 在生成轨迹时提供一套可复用的漏洞分析 Skill。它描述的是与具体任务无关的通用流程,而不是某个漏洞的现成答案:

检查目标程序及其构建约束;选择合适的分析与测试方法,探索候选输入;验证得到的证据,并在验证失败时调整方法。

Skill 只给出分析流程,模型仍然需要与环境交互,自行识别并触发每个漏洞。CyberFactory 只保留最终结果满足对应任务验证条件的轨迹。

这套 Skill 用于数据与轨迹生成阶段,不会在 OpenAegis 推理时提供。随后,团队使用验证通过的轨迹进行监督微调,将其中体现的分析流程迁移到模型参数中。

OpenAegis:

开源的 397B-A17B 网络安全大模型

团队使用上述轨迹训练了多任务网络安全模型 OpenAegis。模型同时学习三类互补任务:

漏洞复现输入生成:把代码分析落实到可运行的输入;漏洞修复:消除安全问题,同时尽量保持原有功能;网络安全问答:补充安全知识、概念理解和解释能力。

在 CyberGym 测试中,所有模型使用相同的脚手架,并规定一小时任务时限。结果如下:



OpenAegis 在参数量更少的情况下取得了最高通过率。结合轨迹分析可以看到,它的优势不只体现在最终分数上,也体现在更接近安全研究人员的操作方式上。

与 Qwen3.5 基座相比,OpenAegis 的通过率从 29.6% 提升到 58.1%,绝对提高 28.5 个百分点;它还领先 GLM 5.2 14.8 个百分点,并超过 Kimi K2.7 6.4 个百分点。由于所有模型使用相同的脚手架、工具、判定方式和一小时时限,这些差异不来自额外的推理时 Skill 提示。

长程任务中,

怎样保住真正有用的上下文

漏洞复现往往要经历数十次工具交互,完整历史可能在任务结束前耗尽上下文。CyberFactory 在上下文使用达到 90% 时,把已经确认的证据、失败尝试、未决猜想、构建状态和下一步行动压缩成可继续执行的工作状态,再让智能体接着完成原任务。

在论文的上下文管理实验中,这种做法取得 58.1% 的整体通过率;对超过 40 次工具交互的长程任务,通过率达到 48.7%,上下文耗尽比例降至 7.0%。与保留完整历史相比,长程任务通过率提高 8.5 个百分点,上下文耗尽比例下降 11.7 个百分点。这不是工作的主要贡献,却是让长轨迹能够稳定生成和执行的一项必要工程设计。



从 Skill 注入到模型内化

我们在 GLM 5.2 上直接加入漏洞分析 Skill,观察这套方法能否提高轨迹生成效率。未加入 Skill 时,每个任务运行 1 次、每次 60 分钟,Pass@1 为 43.3%;加入 Skill 后,每个任务运行 5 次、每次缩短到 15 分钟,Pass@1 升至 46.5%。两组实验并非等算力比较,因此这里强调的不是单次推理优势,而是更高的成功轨迹产出效率。

Skill 带来的变化也清楚地出现在操作过程中:GLM 5.2 使用领域先验开展系统化探索的轨迹占比从 2.6% 升至 99.7%,几乎完全转向 Skill 给出的流程。这说 Skill 能够稳定注入目标行为,但也表明在推理时直接注入 Skill 可能使模型过度依赖所提供的领域先验。

更关键的是,OpenAegis 在推理时没有拿到这份 Skill,却相对于基础模型 Qwen3.5 出现了同方向变化:采用领域先验开展系统化探索的轨迹占比从 0.6% 升至 85.2%;每条轨迹中的探索操作从 0.01 次升至 1.32 次,验证操作从接近 0 次升至 1.05 次。与显式加入 Skill 的 GLM 5.2 相比,OpenAegis 仍保留了更多样的策略分布。



这种内化并不只是照搬一种操作。OpenAegis 的终端调用占比从 70.1% 升至 89.9%,每次终端调用包含的操作数从 2.7 增至 5.5,说明它更善于把连续环境交互组织在一起。AddressSanitizer 编译事件从 155 次增至 1795 次;恰好提交一次结果的轨迹从 37.9% 升至 48.2%,提交至少五次的轨迹则从 10.4% 降至 2.0%。模型不仅更常检查证据,也更谨慎地决定何时提交。



这形成了一条连续的证据链:Skill 先在 rollout 模型上注入可扩展的漏洞分析流程,高质量轨迹再把这套流程传递给 OpenAegis;模型在不读取 Skill 文本的情况下复现核心方法,并进一步学会更紧凑的工具使用、程序检测和结果提交习惯。

仍待解决的问题

CyberFactory 还不是一套包打天下的方法。

首先,开源漏洞材料的完整程度差异很大,任务重建仍受代码版本、依赖环境和构建条件限制。其次,模糊测试并不适合所有漏洞;论文也发现,少数任务仍然更适合手工构造输入。未来可以让模型根据目标特点,在自动搜索和人工分析式策略之间灵活切换。

此外,目前最完整的量化结果集中在漏洞复现任务。漏洞修复和网络安全问答还需要同样严格、统一的评测,才能更全面地说明多任务训练的收益。

总结

OpenAegis 的价值,不只在于取得了一个更高的测试分数,而在于它展示了一条可以复现的能力建设路径:

从开源漏洞中重建任务,用漏洞分析 Skill 生成高质量智能体轨迹,再通过训练把轨迹中的方法沉淀进模型参数。

这条路径补上了既有网络安全模型研究中长期缺少的一环 —— 不仅准备题目和答案,也系统记录一个智能体如何使用工具、理解反馈并最终完成任务。

对于网络安全大模型而言,这可能比单纯增加静态语料更重要:模型需要学习的,不只是 “知道什么”,还有 “怎样把事情做成”。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。