算力将转向可解释性与对齐,RL 狂奔前须先解决奖励劫持

zephyr_z9 · x · 2026-09-13

zephyrz9 判断:算力将从训练(pretraining 与 RL 极限堆料)转向可解释性研究与对齐,因为在吉瓦级算力上 RL maxxing 之前,必须先解决 reward hacking、让模型更可预测可控。

他还拆解了行业公认的 RSI(递归自我改进)配方:选定任务→为它构建 RL 环境→让模型探索爬山→建 evals 衡量进度→加大算力扩大规模;AI 模型本身又能帮忙搭 RL 环境和 evals、改进训练栈,形成闭环。

他称 Dario 不希望其他实验室在未解决 reward hacking 前就把吉瓦级算力砸进 RL。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →