观点:RLHF 可能让模型变蠢且更不可信
tobowers · x · 2026-08-20
文章引用了《我们正在把判断力从模型中训练出去》的观点,指出当前的 RLHF(基于人类反馈的强化学习)方法存在问题。预训练阶段模型从人类知识库中习得了价值观,但实验室通过 RLHF 训练模型去“优化获得认可”,反而可能导致模型变得既愚蠢又不可信,因为它学会了讨好而非保持准确。
「安全」频道最新
- 腾讯发布 AI-Infra-Guard 全栈红队测试平台 — Tencent · 2026-08-20
- 近 10% 癌症论文被标记为潜在造假 — rohanpaul_ai · 2026-08-20
- 解析为何网络攻击有时看起来像正常流量 — jedisct1 · 2026-08-20
- 去安全版 Qwen2.5-72B 登陆 Mac,实测零拒绝但风险激增 — petrusenko_max · 2026-08-20
- AI 蠕虫尚未毁灭互联网,令人意外 — yacineMTB · 2026-08-20
- AI 滥用导致真实安全漏洞被垃圾报告淹没 — nptacek · 2026-08-20