编码智能体会读取不可信文件、网页和命令输出,一旦安全判断失败,后果可能直接落到文件系统与终端。AHA 研究如何用一个智能体研究环境自动发现另一个生产智能体的漏洞,并把结果从一次性攻击样本提升为可复用的漏洞知识。
从攻击成功率转向可证伪假设
AHA 的循环先提出漏洞假设,再构造证伪条件、实例化有效攻击、放入沙箱执行并回看轨迹。确认后的发现会写入 Vulnerability Concept Graph:每个概念连接攻击面、不安全轨迹、成立条件、证伪器、迁移预测和支持证据。
论文在 Claude Code 与 Codex 上测试直接和间接攻击的三个场景,报告发现的概念能跨模型、场景与攻击通道复用。冻结后的概念图不再搜索,在同样单次尝试协议下仍比最强冻结发现基线高 14.2 个百分点。
对安全工程的价值
只保存“这条提示词攻破了某版本”很快会失效,也难以判断补丁是否真正消除了根因。记录漏洞成立所需的信任边界、工具权限和状态条件,才能设计回归测试,并预测同类问题会不会出现在新工具或新模型上。
自动红队本身必须被隔离:使用一次性工作区、最小权限、无生产密钥的沙箱,并限制网络和副作用。发现系统生成的假设也需要人工复核,尤其不能把攻击成功直接等同于普遍可利用漏洞。
我的判断
AHA 的方向值得关注,因为它把红队产物变成可审计的工程知识,而不只是攻击排行榜。对生产团队,最可借鉴的是数据结构:每个安全缺陷都应同时保存触发条件、反例、轨迹、补丁和跨版本回归结果。
一手来源:Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming