智能体要学会行动,通常需要在环境中持续交互。但现有训练环境往往由人工构建,或者围绕某个预先定义的任务和基准生成。这种“以任务为中心”的方式便于控制评测,却难以规模化覆盖现实业务中不断变化、彼此关联的工作流。AgentMercury提出的方向,是先生成一个可持续运行的业务世界,再让任务从世界状态和服务之间的交互中自然出现。

从任务生成转向世界建模

AgentMercury接收高层业务场景,并实例化包含实体、服务、工具和状态的持久化环境。更关键的是,环境中还包含可执行的跨服务不变量,用来约束不同系统之间的关系。这样生成的对象不再只是某个任务的答案验证器,而是一个能够承载多种任务和交互轨迹的执行环境。

论文构建了4,783个可执行环境,覆盖14个行业和50个国家,并将这些环境作为强化学习的训练底座。材料强调,这些环境生成时并未针对评测基准进行定制。训练后的策略在企业工作流以及推理、代码、科学计算和工具使用等域外基准上都获得了明显提升。

结果与可扩展性

具体来看,Qwen3.5-4B在AgentMercury环境训练后,EnterpriseOps-GYM得分从12.3提升到15.7,AIME26得分从45.9提升到56.0。这个结果说明,面向业务世界的训练环境不只服务于企业任务,也可能为其他类型的能力评测提供训练信号。不过,材料没有说明不同环境、训练配置或基准之间的具体贡献,因此不能把提升简单归因于某一种环境设计。

论文还观察到,环境构建过程本身也可以被学习。通过使用构建轨迹微调Qwen3.5-35B-A3B,模型的可执行世界编写成功率得到提升,但摘要没有给出提升幅度或成功率定义。这意味着研究重点不只是批量生成环境,也包括让模型逐步掌握如何编写可运行、可交互的业务世界。

我的判断

AgentMercury的价值在于重新定义了智能体训练环境的粒度:从一次任务的沙盒,转向包含状态、服务和约束的业务系统。对需要训练企业流程、工具调用和跨服务协作的场景,这种设计具有明确吸引力。它的边界也同样清楚:环境质量取决于生成的实体、规则与服务是否足够可靠,摘要没有提供人工验证、错误率或长期运行稳定性数据。现阶段更适合把它看作一种可扩展的环境合成框架,而不是已经解决真实业务仿真问题的完整方案。