RL 能否带来真正的科学发现?奖励信号从哪来成核心难题

IndependentFresh628 · reddit · 2026-09-10

作者提出一个 RL for LLM 的核心矛盾:对于代码、数学等可验证任务,奖励信号容易构造(跑代码、验证明);但当目标是让 AI 做人类尚不知道答案的全新科学发现时,奖励从哪来?

作者猜测出路是让模型与真实世界交互:提出假设→设计实验→运行→观察→更新信念,让现实成为反馈回路的一部分。但验证周期长达数年的发现依然无解。

结论性疑问:纯 scaling RL 是否足以达到自主科学发现,还是需要模型自产自验学习信号的根本新机制?

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →