传统大模型交互通常以“用户输入、模型回答”的轮次推进,适合问答,却难以覆盖自然对话中的打断、追问和持续反馈。论文介绍的 Gander,试图把全模态感知、实时交互和智能体能力放进同一个端到端框架,让模型持续接收视频、语音和文本等多模态流式输入,并在日常交流和复杂工作流中进行全双工互动。
从轮次对话转向持续互动
Gander的关键变化,不只是增加更多输入模态,而是改变了交互节奏。用户可以在任意时刻打断模型,模型也可以主动提供中间反馈,或提出后续问题。这种机制更接近真实的语音交流,也更适合需要持续观察、逐步确认和动态推进的任务。
为了支持低延迟的连续交互,Gander在实时部分采用流式 Thinker-Talker 架构。用户输入和模型输出会在 chunk 层级进一步展平为有序 token 流,形成统一表示。摘要没有给出具体延迟数字,但从设计目标看,该机制服务于连续输入、连续输出,以及交互过程中的即时切换。
Cerebellum-Brain如何分工
Gander采用“Cerebellum-Brain”协同框架。Cerebellum负责实时交互和全模态会话能力,Brain则处理复杂推理与更高层级的智能体任务。两者通过工具调用和智能体编排运行时持续协作,将需要快速响应的对话环节与需要更强推理的工作流环节连接起来。
论文从四个维度评估Gander:对话能力、全模态理解、交互能力和智能体智能。材料还提到,内部人工评测关注其口语表达的自然性与表现力,但未提供完整结果或可复核的量化指标。因此,现阶段更适合把它看作一套面向实时智能体的系统设计探索,而不是已经被公开数据充分验证的通用结论。
我的判断
Gander的价值在于把实时会话和复杂智能体任务放到同一架构中考虑,尤其适合需要语音交流、持续感知、用户随时介入的场景。Cerebellum与Brain的分工也回应了一个实际问题:实时响应和深度推理往往有不同的系统要求。不过,摘要没有披露模型规模、延迟、任务成功率、评测集或外部对比结果,无法据此判断其工程成本和综合性能。它的适用边界仍取决于流式架构的稳定性、工具编排质量,以及两类模块在长流程中的协同效果。