小语言模型长期沿用大模型架构,再通过量化和工程优化压缩到CPU上运行。Daedalus-150M采取了相反路径:先确定目标是普通CPU、单用户、逐token推理和4-bit权重,再为这个场景选择网络结构。它的核心判断是,长上下文推理的成本不应由每一层都读取不断增长的缓存来承担。
结构:六层注意力,十二层短卷积
Daedalus-150M共有18个模块,其中6个保留完整注意力,另外12个使用短卷积。摘要称,这些卷积的记忆宽度始终是两个时间步,因此无论对话变得多长,网络中有三分之二的模块都不会重新读取持续增长的缓存。
这不是简单地减少注意力层,而是把不同模块的职责拆开:注意力保留建模上下文关系的能力,短卷积则承担更适合局部记忆的计算。论文从头训练模型,使用了599亿个token。在一个五任务基准上,模型得到47.31分,高于训练前预先固定的42.20分基线;摘要还称,它超过了GPT-2 124M、Pythia-160M、OPT-125M和GPT-neo-125M,这些模型使用了其三到六倍的数据,也超过了公开分数中的MobileLLM-125M,后者使用过一万亿个token。验证集bits-per-byte为0.8685。
结果:优势随上下文长度扩大
为了区分架构收益和训练配方收益,作者还在相同数据上训练了同规模的全注意力模型,并在评分前预先写下胜负条件。混合架构在选定质量指标上领先0.81%,下游任务表现持平,4-bit文件小6.3%。在2048 token上下文下,它的解码速度是对照模型的1.76倍;与一个外部同规模模型相比为2.08倍。
速度差异的形态尤其值得关注:空上下文时优势接近于零,随着上下文长度增加才逐步扩大。这个现象符合短卷积避免读取增长缓存的机制,也与单纯做了模型瘦身的解释不同。摘要最后提到,作者还用简单的带宽计算进行预测,但给定材料没有提供预测结果的完整内容。
我的判断
Daedalus-150M的价值不在于证明所有小模型都应采用卷积,而在于把推理目标放到了架构设计的起点。对于普通CPU、单用户和较长上下文的本地推理,这种混合结构给出了较清晰的性能收益证据,尤其是速度优势随上下文增长这一点。
但结论仍有边界。材料没有给出具体CPU、任务构成、延迟测量方法和完整硬件条件,因此不能直接把1.76倍当作所有设备上的通用提升。模型也只在150M级别和给定训练设置下被验证。它更适合作为面向部署的架构设计案例,而不是对全注意力模型的普遍替代方案。