用实验室私有数据 RL 预测实验结果,杜绝网络预训练污染

hsu_byron · x · 2026-09-16

研究者提出将世界建模与强化学习结合:把「给定此前全部实验数据预测下一次实验结果」本身作为 RL 任务。关键在于这些数据只存在于其实验室、从未进入任何文献,因此网页预训练无法污染评测——为衡量模型真实的科学推断能力提供了无泄漏的基准思路。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →