大语言模型的代码能力持续提升,网络安全因此成为重要应用方向。材料显示,闭源模型已经展现出较强的网络安全能力,但开源方案仍面临明显缺口:前沿开放权重模型缺少可复现的网络安全训练方案,现有训练工作往往聚焦孤立任务,也缺乏能够规模化生成的智能体数据。CyberFactory试图把这些环节放进同一个开源框架中。
从公开漏洞到训练实例
CyberFactory覆盖概念验证代码生成、漏洞修补和网络安全问答三类任务。它将公开漏洞工件,包括来自真实环境的CVE,转换为可执行、可验证的任务实例。这里的关键不只是扩大数据来源,而是让训练样本具备明确的执行对象和验证过程,模型给出的方案需要在目标环境中运行,并根据结果接受检验。
框架连接了数据构建、轨迹合成与模型训练。对于网络安全任务,单纯提供问题与答案可能不足以呈现完整的解决过程。CyberFactory进一步使用可复用的漏洞分析技能,引导教师模型进行源代码检查、结合领域先验解决问题,并基于证据验证结果。由此生成的监督数据包含工具交互和多轮修正,而不是孤立的最终答案。
训练面向防御的模型
论文基于这些智能体轨迹训练并发布Aegis。其目标是让模型内化由技能引导的处理流程,覆盖漏洞分析相关的任务执行过程。材料将Aegis的命名解释为希腊神话中宙斯和雅典娜的保护盾,强调其防御导向。
我的判断
CyberFactory的价值在于明确提出了一条较完整的开源网络安全训练链路:从公开漏洞材料出发,构造可执行实例,再生成带工具反馈的解决轨迹,最后用于模型训练。相比只针对单一任务构造数据,这种组织方式更接近网络安全工作的实际流程,也为复现研究提供了清晰框架。
但现有材料不足以判断Aegis在不同任务上的具体性能,也不能据此证明它已经达到闭源系统的能力水平。框架依赖公开漏洞工件、教师模型和漏洞分析领域先验,数据覆盖范围、轨迹质量以及执行环境的适用边界仍需进一步验证。对开发者而言,它更适合作为构建网络安全智能体训练数据的参考基础,而不是现成的安全能力保证。