本周的主线不是又出现了多少新模型,而是 AI 系统如何从单次生成走向可持续执行。记忆、上下文、工具调用和环境反馈正在成为智能体工程的核心组件,效率竞争也从推理速度延伸到完整工作流。与此同时,更细的评测不断暴露模型在行动、长程任务与上下文利用上的断层。

智能体竞争转向状态、上下文与工具编排

长期任务首先是状态管理问题。面向创作场景,创作智能体缺的不是模型:JarvisHub 用画布承载长期项目状态把可编辑画布同时用作工作区、外部记忆和行动空间;在代码场景,代码智能体不必反复寻找上下文:CodeNib统一仓库多视图服务则把仓库视图做成可复用的上下文服务。两者指向同一件事:与其让模型在每一步重新理解世界,不如先把环境组织成稳定、可查询、可更新的结构。

记忆也在从外围组件进入模型设计。把记忆写进基础模型:Metis 探索无需梯度的在线记忆尝试让模型通过一次前向计算更新持续演化的记忆状态;但智能体记忆真正的盲点:事实存得住,却未必能被问题唤起提醒我们,保存事实不等于能够在隐式关联查询中正确唤起。开发者需要分别验证写入、检索、知识桥接和最终使用,而不能用一项记忆命中率概括整个系统。

工具层同样开始强调选择而非堆叠。工具不是越多越好:Beacon让视觉智能体判断何时调用工具关注调用时机和实际收益,相关性不只用于召回:RARG让语料交互搜索更快收敛则以相关性引导搜索路径。智能体架构的重点,正在从是否接入工具转为是否能控制工具带来的成本、噪声与错误传播。

效率开始按完整工作流计价

本周的效率讨论明显超出了单次推理延迟。GPT-5.6 不只追求更强:把模型、推理与智能体效率放进同一账本把模型、推理和智能体工作流放进统一成本框架;GPT-5.6降低Luna与Terra价格:企业部署转向单位成本竞争进一步把效率变化传导到价格。对企业部署而言,真正重要的指标不只是 token 单价,而是完成一个可验收任务需要多少轮调用、多少上下文和多少失败重试。

配置本身也可能显著改变结果。两个 API 设置让成绩翻三倍:GPT-5.6 的评测配置启示显示,保留推理并启用 compaction 后,特定基准得分和效率都发生明显变化。这意味着模型评测与生产调优都必须记录完整调用参数,不能把结果简单归因于模型名称。

底层优化则继续沿着结构化取舍推进。稀疏注意力不再先算路由图:Sol-Attn 在线筛选视频生成关键块尝试减少视频扩散模型的注意力开销,统一位宽并不划算:MixFrag按脆弱度分配ViT量化精度按组件脆弱度分配量化位宽,而长期记忆比底座扩参更划算:6.9B 模块以更少参数超过 12B 模型探索独立扩展长期记忆的参数效率。这些工作共同说明,平均分配算力、精度和参数未必是最优方案。

评测正在从总分走向失效定位

更有价值的评测,不只是宣布模型未通过,而是说明失败发生在哪一层。会看三维场景不等于会行动:SceneActBench揭示智能体能力断层以统一智能体—环境循环评测五类三维任务,结果显示多种专有 VLM 配置都无法跨任务保持稳定;多模态上下文学习仍未过关:CLBench-V拆解三类能力断点则通过三维任务拆分上下文利用的具体失效环节。单项能力看似成立,并不代表它能在闭环任务中可靠组合。

基准数据本身也需要被审计。SWE-Bench 配对并不总可靠:PAIChecker 用多智能体核验错位发现 SWE-bench Verified 中有 13.6% 的样本存在 PR-Issue 错位;把合并 PR 变成可执行任务:Change2Task 扩充代码智能体数据则从仓库历史构造可验证任务。代码智能体的进展越来越依赖任务定义、数据配对和验证器质量,而非只依赖模型升级。

推理策略也需要公平计费。多想不如多采样:等 Token 成本下自我反思未能胜出表明,在实际生成成本对齐后,自我反思并未可靠优于重复采样;评测不再固定:DecoEvo让求解器与评分规则解耦共进化则尝试缓解开放任务中固定评分信号失效的问题。比较推理方法时,应同时控制 token、采样次数、工具调用与评分器变化。

具身智能的瓶颈仍是从感知到执行

机器人研究继续证明,视觉理解和语言规划只是链路的一部分。看得见却管不好身体:HumanCLAW拆分具身决策与运动执行通过原子技能隔离底层运动误差,暴露 VLM 在具身自我感知上的短板;从视频理解到多机协作:Gemini ER 2 强化机器人现实任务推理则把视频理解、工具编排和多机器人协作纳入统一框架。方向正在从识别环境转向维持长期、协同且可执行的任务状态。

数据和控制频率构成另外两项硬约束。具身智能没有互联网捷径:五类数据源重画机器人训练配方强调数据可扩展性与机器人对齐之间的张力,真机后训练不再是必需:HiFi-UMI仅凭高保真示范直接部署尝试以更高质量的无机器人示范减少真机后训练需求;绕开大模型中枢:TurboVLA 以 0.2B 参数实现 32 Hz 控制则显示,实时控制可能需要绕开庞大的通用模型中枢。具身系统最终要在数据质量、推理能力和控制时延之间做工程折中。

值得注意的信号

我的判断

本周最值得关注的不是某个单项榜单,而是评价单位正在变化:从一次回答变成完整任务,从模型参数变成系统状态,从推理速度变成单位成本下的有效交付。

对开发者而言,接下来更实际的工作不是继续无差别增加模型、工具和上下文,而是建立可观测的执行链路:明确状态存在哪里、工具何时调用、失败如何归因、成本怎样核算、结果由谁验证。现有研究已经反复显示,感知、记忆或推理的局部高分不能自动组合成稳定智能体。

同时也应保持克制。本周不少热点只有标题、讨论热度或机构摘要,尚不足以判断技术幅度。可以确认的是,AI 系统正在变得更复杂;尚不能确认的是,这种复杂度是否已经稳定转化为生产价值。现阶段,比追逐能力宣称更重要的,是用真实任务、完整配置和可复现成本持续验证。