Intern-S2-Preview: Scientific Agentic Foundation Model
Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou
cs.LG, cs.CL, cs.CV
2026-08-14
上海 AI Lab 发布 397B 参数科学 agent 基础模型 Intern-S2-Preview,叠加多任务 RL 与黑白盒 agentic RL,外挂 4B 记忆模块把生物学任务均分从 56.92 提到 60.32,且不改冻结主干。
科学发现需要模型做的事,远不止回答一道选择题:得读懂图表、光谱、遥感影像这类异构证据,还得会用工具、能在长任务里持续推进。现有模型要么是通用 LLM,推理和指令跟随能力强,但对科学专属的模态、协议、工具交互没有专门优化;要么是科学多模态模型,擅长感知和推理某类专业输入,但大多还是当静态问答系统来评测,没有真正当长程 agent 用过。上海 AI Lab 的 Intern-S2-Preview 想把这两条线拉到一起,做一个既懂科学多模态证据、又能持续和工具与环境交互完成长任务的基础模型。
训练分两大阶段。预训练阶段专门喂科学多模态数据:对渲染出来的科学文档页面做视觉预训练,直接从页面图像预测视觉隐变量,弥补纯文本抽取会丢失的版式信息;另外构造了图文交错的 PDF 数据,解析页面、裁出有信息量的视觉区域、按版式顺序重新组织文本和图像;再配一套大规模图像检索管线专门为多模态训练召回高质量科学图像。
后训练是一条统一流水线:先做监督微调打好指令跟随和工具使用的底子,再上可扩展的多任务强化学习,用可验证目标同时优化推理深度、正确性、科学生成质量和响应效率,并配了一套叫 GEPO(Group-level Entropy-Controlled Policy Optimization)的方法平衡不同任务组的探索强度。针对长程 agentic 任务,团队做了一套黑盒白盒 agentic RL 框架,用执行环境(harness)乘任务的抽象把 agent 运行时和可执行任务解耦,让不同的工具调用 agent 和任务共用同一套 rollout、验证、训练协议;任务来源包括公开的代码与终端基准,以及一个基于社区技能自我演化生成任务的系统。最后用 on-policy distillation 把分别训练出来的推理专家和 agentic 专家策略蒸馏合并进统一的 Intern-S2-Preview 模型。支撑这条流水线跑得动的是几个系统层面的技巧:带 off-policy 校正的 partial rollout、自适应长度正则化、在线投机解码、稳健的多任务优化,以及面向 agentic 任务的 trace-aware 经验组装。
架构上有两处扩展。397B 主干加了专门的预测分支,把时序建模能力从长序列理解延伸到数值预测。另外单独训练了一个 Memory Decoder,通过独立的参数化记忆模块给冻结的 397B 主干挂载额外的领域知识,不用改主干参数就能做快速的科学领域专精。
在 Biology-Instructions(56.92)、Mol-Instructions(52.37)、SciReasoner(63.97)等科学基准上,Intern-S2-Preview-397B 超过了对比的开源和闭源模型,在内部的 MP20、ProteinBinder-9 评测集上也拿到最好成绩;在 MolecularIQ、TOMG-Bench、XLRS-Bench、MicroVQA 上是开源模型里最好的。通用基准上,它在 MMLU-Pro(89.75)、SimpleQA-Verified(69.90)、MMMU-Pro(80.46)、ChartQAPro(69.65)几项上都是开源模型最高分,但整体和 Gemini-3.1-Pro、GPT-5.5 这类闭源旗舰仍有差距,比如 SimpleQA-Verified 上 Gemini-3.1-Pro 是 75.60。agentic 任务上,它在 SkillsBench、TerminalBench 2.1、SWE-Bench-Pro、SWE-Bench-Multilingual、WildClawBench 几项整体超过 DeepSeek-V4-pro 和 Qwen3.5-397B,但落后于 GLM-5.2。
时序理解上,在 SciTS 基准的多个任务里明显超过通用文本和视觉语言 LLM,PHU01 任务的 F1 从 36.8(参照模型 Intern-S1-Pro,1T 参数)提到 66.9,而 Intern-S2-Preview-397B 参数量不到 Intern-S1-Pro 的一半。时序预测上,专用数值分支让它在 SciTS 多个子任务上超过专门做时序预测的基线模型,horizon 长度预测准确率达到 99%,在通用时序预测基准 GIFT-Eval 上零样本 MASE 0.785。Memory Decoder 的验证实验里,单独训练一个 4B 参数的生物学记忆模块(Intern-MemDec-4B)挂到冻结的 397B 主干上,把 Biology-Instructions 21 项任务的平均分从 56.92 提到 60.32,同时在通用知识、推理、多模态基准上和不挂记忆模块时基本一致,说明这种外挂记忆没有拖累主干的通用能力。
这篇的价值不在单项 SOTA,而在把科学多模态感知、长程 agent 能力、领域可扩展性做成了一套可复现的工程流水线。Memory Decoder 这条路径尤其值得关注:给冻结主干挂一个几 B 参数的小模块就能显著提升某个科学子领域的表现,且不牺牲通用能力,这比每换一个领域就全量微调一次 397B 模型便宜太多,对资源有限的科研机构或垂直领域团队是个现实的技术路线。agentic RL 里的 harness 与 task 解耦设计也提供了一个可复用的思路:把 agent 运行时和任务分布拆开,方便持续加新任务而不用重新设计训练协议。
论文自己说 Intern-S2-Preview 仍然是一个 preview 系统,未来要改进更长科学工作流上的可靠性、扩充领域记忆和任务环境、加强验证器、深化和专业科学工具的集成。论文没有明说的地方是,在通用能力上它与顶尖闭源模型(GPT-5.5、Gemini-3.1-Pro)仍有明显差距,agentic 任务上也排在 GLM-5.2 之后,所以科学 agent 能力这个卖点更多体现在专项科学基准和时序建模上,不是全面反超顶级通用模型。另外 Memory Decoder 的验证目前只做了生物学一个领域的案例,能否稳定推广到材料、地球科学等其它科学领域,论文没有给出证据。