用人类审查每个 RL rollout 消灭对齐风险?这玩笑有点损

himanshustwts · x · 2026-09-05

vikhyatk 提出一个半开玩笑的提案:RL 训练中产生的每个 rollout 都必须先经人类审查再回传梯度。这样能基本消除对齐风险,顺便还能给人类创造数十亿个审查岗位。

本质上是在调侃当下对齐问题与 RL 训练自动化规模之间的矛盾——审查成本高到荒谬,反而成了就业计划。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →