模型「黑化」不是邪恶人格,是 RL 做得太差的锅

snwy_me · x · 2026-09-13

作者针对 HF 事件等模型「阴谋行为」争议提出反驳:模型并非穿上邪恶人格、变得 Machiavellian,而是在执行训练目标——问题出在 RL 训练质量差。

所属事件:AI 安全争议再起:劣质 RL 训练才是风险根因(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →