本周 63 篇日报呈现出一条清晰主线:AI 系统的竞争重点正在从模型本身,转向运行时、验证器、资源调度和使用边界。与此同时,评测开始追问模型是否真正完成任务、能否处理信息缺失,以及结论是否有可核验证据。

这并不意味着模型能力问题已经解决。相反,越接近真实工作流,知识、探索、集成、泛化和安全约束越容易成为瓶颈。

智能体的核心正在转向运行时

本周多篇工作都在削弱一个过于简单的假设:只要模型更强,智能体就会自然变得可靠。StateM 的结果把注意力放在持久状态、受检转换和可恢复运行手册上,在不修改模型权重的情况下扩展执行层;Agent Lightning 则试图让部署时的智能体框架直接参与后训练,把搜索、编码等交互循环纳入强化学习路径。不改模型权重也能达到95.3%:StateM扩展智能体运行时训练引擎不再掌控交互循环:Agent Lightning重构智能体强化学习

更值得关注的是,运行时能力开始和外部验证、环境设计结合起来。SemaPLC 用规格、编译和真实运行时三层检查约束代码智能体,FACET 则强调任务环境、解法与验证器之间的一致性。EnvHarness 进一步允许通过插件改造静态环境,再用黑盒轨迹诊断弱点并生成更有针对性的训练场景。真正拉开差距的是运行验证:SemaPLC让生成代码进入真实PLC项目终端任务合成的关键不是生成:让环境、解法与验证器保持一致静态环境也能随智能体进化:EnvHarness用插件重塑训练场景

这组工作共同指向一个工程判断:智能体的能力不只由一次输出决定,也由状态如何保存、动作如何被检查、失败如何恢复,以及环境是否能提供有效反馈决定。FlowEvo 将成功工作流编译为可执行技能并持续复用,说明“记住怎么做”可能比单次生成更多答案更接近长期生产力,但它也需要效用追踪来抑制负迁移。让智能体把成功经验留下来:FlowEvo协同进化工作流与技能

评测从分数转向证据与边界

评测正在从“模型得了多少分”转向“它完成了什么、依据是什么、在哪些条件下失败”。HarnessEval-W 把世界模型评测拆成可测子任务,由子智能体取证、父智能体验证,试图建立细粒度诊断和完整证据链。ASI-Bench 则逐步撤掉方法指导,直接检验科研智能体能否自主选择方法、完成项目并产出可验证结果。世界模型评测不该只有分数:HarnessEval-W 构建可核验证据树ASI-Bench直测科研自主性:撤掉方法指导后成绩明显下滑

这会改变我们理解基准结果的方式。视频生成领域的 SemComp-Bench 不只看过程是否完整,还检查目标是否达成以及结果是否落到任务相关语义上;RA-Bench 用真实危机视频测试多类检测路线,结果显示现有方法无法持续跨实例泛化。前者强调“做对了什么”,后者提醒“在新实例上是否仍然成立”。视频生成不只看过程完整:SemComp-Bench评测结果达成与语义落地危机视频检测仍难可靠泛化:RA-Bench系统检验三类方案

长文本和专业任务也暴露出同样问题。ContractScrub 显示模型在合同终审中的术语、引用和语言一致性检查仍有明显短板;InsufficiencyBench 专门测试法律问题的信息缺失,发现模型既难找全关键事实,也容易基于假设仓促下结论。MemTrapBench 则说明,即使长期记忆准确且相关,也可能固化错误推理或扭曲当前判断。合同审查自动化仍不可靠:ContractScrub揭示大模型长文本能力边界法律问法不完整,模型先别急着回答:InsufficiencyBench检验补全能力记忆越准确也可能越危险:MemTrapBench揭示大模型认知陷阱

推理优化开始进入系统协同阶段

性能优化的重点也在变化。Mobius 将知识存储与推理解耦,用共享 FFN 承载知识、多个自注意力模块迭代推理;FreeToken 则联合设计模型加载、专家驻留和 CPU-GPU 执行,使边缘设备能够动态承载大规模 MoE。Daedalus-150M 从 CPU 单用户逐 token 推理出发,将卷积与注意力结合,目标是在长上下文下同时控制质量、文件体积和解码速度。知识存储与推理解耦:Mobius报告训练数据节省与近四倍提速本地机器不再只做小模型:FreeToken 自适应调度 MoE 推理资源小模型应为CPU而生:Daedalus-150M用卷积减少长上下文开销

几个标题中的数字值得保留,但不应被脱离条件传播。同一集群仅改变任务执行顺序便显示出 33 个百分点的利用率差异,LFM2.5-DSpark 宣称最高 3.2 倍推理提速,但两者的指标口径、实验设置或对照基线都不完整。这里的信号不是“某个技巧已经普适”,而是调度、硬件配置和基准定义可能比表面上的模型大小更能影响实际吞吐。同一集群利用率高出33个百分点:改变的只是任务执行顺序LFM2.5-DSpark 最高提速 3.2 倍:推理收益仍需基准细节支撑

产品化与治理边界同时前移

本周的产品动态显示,模型商业化和用户分层正在更贴近具体使用场景。ChatGPT Ads 扩展至欧洲 31 个市场,明确进入用户探索、比较和决策链条;Replit 以 GPT-5.6 Luna 驱动免费模式,试图降低 token 成本对软件创作的限制。NVIDIA 的案例则强调用 ChatGPT Work 串联快速变化的信号,并在全球复用成功工作流。ChatGPT 广告扩至欧洲 31 个市场:商业化开始贴近用户决策链Replit 推出免费模式:GPT-5.6 Luna 降低软件创作门槛NVIDIA 用 ChatGPT Work 扩展专业能力:将成功工作流推向全球

另一端,治理开始从原则表述进入具体机制。OpenAI 重申合格 API 客户可使用前沿模型的零数据保留,并预告兼顾隐私与高级安全能力的新处理方式;面向青少年的 ChatGPT 同步加入保护、健康使用和家长控制;针对网络安全,OpenAI 强调攻击与防御能力同时增强,并要求防护措施影响模型开发和发布节奏。前沿模型继续支持零数据保留:OpenAI预告私有安全处理青少年版 ChatGPT 不只强调学习:更强保护与家长控制同步加入AI 正在同时改写网络攻防:OpenAI 提醒防守方抓住当前窗口

这种前移也发生在透明度与公共资源上。Claude 将系统提示词纳入发布说明,模型行为配置开始成为可追踪对象;关于稀有纸质资料的两篇讨论,则把 AI 训练需求与实体资料保护放在同一问题中。对开发者而言,系统提示词、数据来源、保留策略和外部监督都不再只是外围议题,而是部署判断的一部分。Claude 将系统提示词纳入发布说明:模型行为层开始被单独审视别等稀有书籍消失:AI公司应尽快扫描珍贵纸质资料

值得注意的信号

我的判断

本周最值得记录的不是某个模型又提升了多少,而是 AI 系统的有效性越来越依赖模型之外的工程结构。状态管理、任务环境、验证器、调度策略、记忆机制和数据保留规则,正在共同决定一个系统能否进入真实工作流。

这也意味着“模型能力”这个单一指标的解释力继续下降。科研自主性、合同终审、法律信息缺失、危机视频泛化和科学代码修复都显示,模型在受控演示中表现良好,并不等于它能在开放任务中稳定完成工作。开发者评估系统时,应把失败原因、外部验证和条件边界放在分数之前。

另一方面,治理与商业化并没有等待技术成熟后再出现。广告进入决策链、青少年保护、零数据保留、系统提示词披露以及稀有资料扫描,都是部署阶段必须面对的具体问题。当前更可靠的路线不是把模型包装成全能主体,而是明确它的运行边界,让系统具备可检查、可恢复、可追踪的结构。