研究者提议:把「人类 grokking 时间」纳入 RL 奖励信号

PeterHndrsn · x · 2026-10-12

作者 PeterHndrsn 提出一个 RL 训练设计观点:几乎所有强化学习环境——尤其是数学任务——都应把「time to human grokking」(人类理解透该解法所需的顿悟时间)纳入奖励函数的一部分。其逻辑是,仅以结果正确性奖励会让模型学到人类难以理解的解法,若奖励中包含人类理解的成本,模型会倾向于产出更可读、更可迁移的解;为此需要更好地研究人类是如何学习和理解事物的。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →