自动科研是科学终极形态,RL 探索新行为效率高 5 倍

const_reborn · x · 2026-08-28

转发者提出“科学的终极形态是货币反馈下的自动研究循环”。

被引用的 Induction Labs 介绍了“Intrinsic Discovery”方法:利用强化学习在环境中发现新行为。模型因到达此前未发现的状态而获得奖励,并在每次更新后重新采样以进一步推动探索。实验表明,该方法发现的全新状态数量是冻结基线模型的 5 倍。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →