RynnBrain 1.1试图把具身模型从视觉与语言理解进一步推向可执行的机器人操控。该系列覆盖2B、9B和122B-A10B三档规模,在统一的时空与物理基础框架下,同时处理具身感知、空间推理、定位和规划,而不是分别为单项能力建立模型。
从空间理解到操控接口
相较RynnBrain 1.0,新版本在整个模型家族中加入接触点预测,使输出能够描述机器人与目标发生交互的位置。2B和9B模型还获得原生3D grounding能力,可直接在三维空间中建立语言、场景与目标位置之间的对应关系。
这两项变化的重点不只是增加评测任务,而是让模型表示更接近机器人操作所需的信息。接触点可以连接感知结果与具体动作,三维定位则有助于处理物体位置和空间关系。不过,摘要没有说明122B-A10B为何未列入原生3D grounding范围,也未提供各档模型的训练数据、计算成本及能力差异。
统一动作空间连接多种机器人
团队进一步构建了RynnBrain-VLA,以统一的跨本体动作空间表示不同机器人的动作,并通过本体专用掩码处理平台差异。模型已部署到Unitree G1、Astribot-S1和Tianji-Wuji三种机器人上。
评测方面,122B-A10B在VSI-Bench、MMSI和RefSpatial-Bench上超过论文评估范围内的专有及开源模型。真实机器人实验中,使用RynnBrain初始化的策略优于Qwen初始化方案和具有代表性的通用VLA;联合多任务、多本体训练的过程得分与成功率也高于逐任务训练。摘要未给出具体分数,因此目前只能确认相对结果,无法判断优势幅度与稳定性。
我的判断
RynnBrain 1.1最有价值的方向,是把空间理解、接触位置和动作表示放入同一具身模型体系,并尝试跨机器人共享训练,而非只追求视觉问答式的具身认知成绩。这种设计更贴近通用机器人策略的需求。
但现有材料仍不足以证明其已具备广泛泛化能力:真实部署证据来自三类机器人,基准领先也受具体评测范围限制;数据构成、任务难度、训练开销和失败案例均未披露。它更适合被看作具身基础模型与VLA统一化的一次有力推进,而不是已经解决跨本体通用控制。