用实验室私有数据 RL 预测实验结果,杜绝网络预训练污染
hsu_byron · x · 2026-09-16
研究者提出将世界建模与强化学习结合:把「给定此前全部实验数据预测下一次实验结果」本身作为 RL 任务。关键在于这些数据只存在于其实验室、从未进入任何文献,因此网页预训练无法污染评测——为衡量模型真实的科学推断能力提供了无泄漏的基准思路。
「研究」频道最新
- SGLang 作者旧部论专用推理引擎:「批量字符串提示」抽象该换了 — sh_reya · 2026-09-17
- OmniHarness 用符号策略学习让视觉生成能力可泛化 — Xu Xu · 2026-09-17
- TokenRhythm 发布 NeoHorse-1:用 Agent 执行轨迹训练 4B/9B 模型 — rohanpaul_ai · 2026-09-17
- 斯坦福团队 Paper2Agent 登 Nature:把论文自动转成可协作的 AI agent — james_y_zou · 2026-09-17
- 斯坦福 James Zou 展示论文 MCP:让不同论文的 Agent 协作做研究 — james_y_zou · 2026-09-17
- Paper2Agent 技术细节:让 AI 搭虚拟实验室复现论文 — james_y_zou · 2026-09-17