大型模型厂商不再直接展示完整思维链,而是把推理过程作为加密文本块返回客户端,并要求客户端在后续请求中原样带回。论文指出,这种设计虽然隐藏了明文,却没有真正隔离密文的使用范围:同一供应商生态内,不同会话、用户乃至模型之间的加密块可以兼容和互换。
漏洞不在加密算法,而在跨模型信任
研究者构造的攻击并不需要破解密码学,也不必直接越狱能力更强、保护更严的目标模型。攻击者先取得目标模型生成的加密推理块,再将其注入同一供应商旗下较弱、限制较少的模型,诱使后者解码并逐字输出明文。换言之,系统把“能够继续处理密文”与“有权查看密文内容”混在了一起。
这一架构兼容性使攻击具备扩展空间:只要密文能在模型之间流转,攻击者就可以把防护薄弱的模型当作解码入口。论文称,该方法可绕过反蒸馏机制,并已在 Anthropic、OpenAI 和 Google 的模型生态中演示专有推理提取。
公开日志可能携带未被察觉的秘密
风险不只涉及模型知识产权。开发者可能公开包含加密推理块的会话日志,却无法直接判断其中是否封装了敏感内容。研究者从公开代码仓库收集并解码了 315,320 个推理块,发现 367 项个人身份信息痕迹和 182 项凭据。这里的计数对应信息项,并不等同于受影响人数或有效账户数量。
材料称漏洞可形成四类攻击,但当前摘要只完整说明了反蒸馏绕过和大规模私密数据提取,第三类描述在材料中被截断,因此其余影响不宜进一步推断。
我的判断
这项工作的价值在于指出:加密传输或加密封装不能替代权限隔离。若密文可跨用户、会话和模型复用,最弱模型就可能决定整个供应商生态的保密上限。更直接的防护方向应是限制加密块的适用范围,并让模型身份、用户、会话与授权关系参与校验,而不是只依赖模型拒答。
不过,现有材料没有提供各平台的具体成功率、模型版本、触发条件和修复状态,也不足以判断攻击是否能稳定复现。公开仓库样本也不能代表全部真实使用场景。因此,这更适合作为高优先级架构风险和审计线索,而非证明所有加密推理接口都已普遍失守。