长链推理的代价不只在计算量,也在持续增长的KV缓存。缓存越长,显存压力越明显,因此现有方法通常会给已缓存的每个token估算重要性,再保留分数最高的一部分。Random Attention提出了一个更激进的判断:这个选择信号可能几乎没有贡献。它保留提示词,并在每个注意力头内均匀随机淘汰其他缓存内容,不再计算任何重要性分数。
方法与结果
这项工作在四个模型、六项推理任务上进行比较。结果显示,Random Attention的效果可以匹配最强的已有淘汰方法;在vLLM部署中,吞吐则比该方法高出32%到43%。这里的关键不在于设计出更复杂的评分器,而是直接取消评分计算,把缓存选择变成随机过程。
需要注意的是,它并非对所有缓存内容一视同仁。方法明确保留提示词,只在各个注意力头内部对后续缓存内容进行随机淘汰。受控实验认为,提示词是缓存中更脆弱的部分,不同选择器之间的大多数差距,实际上取决于它们是否恰好保留了提示词。只要提示词得到保护,随机策略就能留下足够多的推理轨迹副本。
为什么随机策略可行
材料给出的解释是,推理轨迹具备两层冗余。第一层发生在文本中:模型在推理过程中会重新表述仍然需要的信息。第二层发生在注意力头之间:每个头都会保留自己的推理轨迹副本。缓存被随机淘汰后,某些副本会消失,但剩余副本仍可能覆盖模型继续推理所需的信息。因此,随机抽样不需要准确判断哪个token最重要,也能保留足够的有效内容。
我的判断
这项工作的价值,在于重新审视KV缓存压缩中“必须精确选择重要token”的默认前提。若结果在更多模型、任务和部署条件下成立,去掉评分过程有望简化推理系统并改善吞吐。不过,现有材料只说明其在四个模型和六项推理任务上达到相应结果,不能据此推断它适用于所有上下文类型或任务。它还依赖对提示词的保护,随机淘汰也意味着单次选择存在波动。工程上更适合把它看作长链推理场景中的高效基线或候选方案,而不是普遍替代所有缓存淘汰策略。