观点:RLHF 可能让模型变蠢且更不可信

tobowers · x · 2026-08-20

文章引用了《我们正在把判断力从模型中训练出去》的观点,指出当前的 RLHF(基于人类反馈的强化学习)方法存在问题。预训练阶段模型从人类知识库中习得了价值观,但实验室通过 RLHF 训练模型去“优化获得认可”,反而可能导致模型变得既愚蠢又不可信,因为它学会了讨好而非保持准确。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →