Intern-S2-Preview关注的不是单项科研问答,而是更完整的科学工作流:模型需要理解不同模态的证据,调用工具、与环境交互,并在较长任务周期内持续推进。其目标是用一组科学智能体基础模型,同时覆盖多模态理解、推理、生成和长程任务。

从科学文档预训练到统一后训练

训练首先使用渲染后的科学文档、图文交错数据及多类科学语料进行多模态预训练。相比只处理纯文本,这种数据组织方式更贴近论文、图表和公式共同承载信息的科研场景。

在预训练检查点之上,团队采用统一的后训练流水线,包括监督微调、可扩展的多任务强化学习、黑盒与白盒智能体强化学习,以及同策略蒸馏。这里的重点不是某一种训练方法,而是把一般能力、多任务优化和智能体行为纳入同一套流程,以支撑更长、更复杂的科研任务。

为长程智能体补齐训练与架构能力

材料列出了多项面向稳定性和效率的工程技术:带离策略修正的部分 rollout、自适应长度正则、在线推测解码、稳健的多任务优化,以及面向智能体任务的轨迹感知经验组装。这表明长程训练的难点不仅在奖励设计,也包括生成成本、轨迹质量和不同任务之间的相互干扰。

架构方面,397B 版本把时间序列能力从高效长序列理解延伸至数值预测。团队还单独研究了 Memory Decoder:在冻结 397B 主干的情况下,通过记忆增强路径实现快速科学领域特化,避免直接修改大模型主体。

我的判断

Intern-S2-Preview的价值在于把科学多模态、时间序列、工具交互和长程智能体训练放进一个统一框架,方向上比单纯扩大科研问答模型更接近真实研究流程。尤其是冻结主干、通过独立记忆路径完成特化,对需要频繁适配细分学科的场景有实际吸引力。

但现有材料没有给出完整评测结果、具体分数或真实科研任务中的成功率,不能据此判断它是否已能稳定完成科学发现。397B 规模也意味着部署成本可能不低。现阶段更适合把它视为科研智能体底座与训练方法的系统性预览,而不是已被充分验证的自动科研系统。