网友:可解释性若成,RL 训练可自动修正失败模式

mayfer · x · 2026-09-03

mayfer 在回复 Nick Cammarata 的讨论中提出:如果可解释性研究取得成果,那么大规模 RL 训练中由 mechinterp 检测到的失败模式,理论上可以被自动修正掉。他还猜测自己可能对 CoT 失效的理解有偏差,以为那只是模型语言向 AI 味表达漂移。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →