Hugging Face Daily Papers 介绍了 T1:一个面向长时程终端任务的混合专家模型,总规模为 122B。它不只是生成代码或命令,而是在云端沙箱中运行真实 Shell,单个任务最多进行 300 多轮工具调用,并根据任务自身的验证器执行结果获得奖励。论文报告显示,T1 将基础模型在 Terminal-Bench 2.1 上的解决率从 43.8% 提升至 64.0%,在更长时程的 Long-Horizon Terminal Bench 上达到 27.9%,并超过 GPT-5.4 和 GLM-5.1。

核心方法:让强化学习适应长链路执行

T1 的训练首先采用较激进的 warm start,以稳定 actor-critic 训练;随后加入过程奖励,根据一条轨迹中通过的验证器数量进行密集评分。这个设计把最终任务是否完成,拆解为多个可观测的中间进展,适合工具调用次数多、错误可能在较晚阶段暴露的终端任务。

论文还重点处理训练和推理之间的偏差。TITO 使用采样时准确的 token 标识进行训练,并在每轮工具调用边界修复漂移;R3 则记录采样器在每个 MoE 层选择的专家,并在训练时重放这些路由。两者结合后,训练到推理的对数概率差异从 0.021 降至 0.013,损失区域实现了完全对齐的零 token 漂移。

数据与评测:强调能力迁移

T1 的训练语料与 Terminal-Bench 2.1 完全隔离,使用独立种子和合成任务,避免直接围绕公开基准拟合。这个设置使论文试图回答的重点不只是“能否刷高一个分数”,而是模型能否把终端操作、规划和验证能力迁移到未见过的任务上。评测结果表明,T1 在标准终端基准和长时程终端基准上都取得了提升,但后者的解决率仍为 27.9%,说明这类任务的可靠完成依然困难。

我的判断

T1 的价值在于把终端智能体的训练目标,从单步命令生成推进到可验证的长链路执行。真实 Shell、任务级验证器和过程奖励的组合,对代码开发、实验操作等需要反复试错的场景有参考意义。它的适用边界也很明确:效果依赖任务是否提供可执行、可判定的验证器,云端沙箱和大规模工具调用带来的训练成本,材料中没有给出具体数据。与此同时,Long-Horizon Terminal Bench 的结果仍显示,面对更长任务时,稳定规划和持续纠错尚未成为已解决问题。