Ben Todd:RL 同样适用难验证领域,METR 各处均见快速进步

ben_j_todd · x · 2026-09-10

Ben Todd 回应「RL 只能在可验证任务上有效」的质疑,认为强化学习在难以验证的领域同样有效,只是需要更多时间和算力。

他的论据包括:

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →