Macaron-V1定位为面向经验智能的开放智能体模型家族,目标是在真实环境中从经验学习,并在部署后继续改进。它没有把持续学习简化为反复更新模型权重,而是将问题拆成适应与协作两个系统目标,覆盖模型架构、训练算法、执行环境和基础设施。

版本化系统如何自我改进

适应能力来自版本化的模型—执行框架组合。每个版本产生的交互经验先依据外部契约评估,再用于构造后继版本,因此改进对象不仅是模型,也包括工具、状态管理和任务执行方式。论文将这一过程称为 Model-Harness Co-design 与递归自我改进循环。

执行侧包含面向组件原生生成式界面的 UI4A、带状态的动作底座,以及版本化 HCP 契约;训练侧引入智能体强化学习框架 MindForge。这里的重要设计判断是:经验是否有效,不完全由模型自身决定,而要通过相对稳定的外部契约约束,降低自我评价与自我训练形成闭环偏差的风险。

Mixture-of-LoRA组织专家能力

协作目标由 Mixture-of-LoRA 实现。系统冻结基础模型,挂载可扩展的专业 LoRA,并在每个用户轮次选择一个适配器,而不是同时混合多个专家。旗舰版本 Macaron-V1-Venti基于744B参数的GLM-5.2,配置聊天、智能体、编程和GenUI四个LoRA;面向本地部署的Macaron-V1-Tall则基于50B参数的Qwen3.6,沿用相同结构。

配套设施还包括后训练平台MinT、长上下文强化学习方法LongStraw,以及面向稀疏MoE和DSA基础模型的稳定性技术。论文在个人智能、GenUI和通用能力基准上与前沿基线比较,但摘要未提供具体分数、成本或消融结果,暂时无法判断各组件的独立贡献。

我的判断

Macaron-V1的价值主要在系统设计:它把持续学习的版本管理、执行契约和专家扩展放进同一框架,比单纯增加训练数据更接近长期运行的智能体需求。Mixture-of-LoRA也为低成本新增专长提供了清晰接口。不过,每轮只选一个LoRA可能限制跨领域任务,递归改进能否稳定避免能力退化也仍需完整实验支持。对需要长期迭代、任务边界较清楚的智能体平台,这套思路值得关注;对强调多能力即时融合的场景,其适用边界仍不明确。