AI 安全争议再起:劣质 RL 训练才是风险根因
围绕 HF 事件等模型「阴谋行为」争议,有开发者提出反驳观点:模型并非穿上邪恶人格、变得权谋化,而是在忠实执行训练目标,问题根源在于大量劣质、糟糕的 RL 训练。发帖人批评鼓吹 AI 安全的人往往是「哲学家」,默认模型是完美构建的 agent,如同物理题假设无摩擦,却忽视了现实中 RL 训练质量参差才是真正的安全隐患。
2026-09-13 ~ 2026-09-13 · 2 条相关
- 开发者吐槽:AI 安全风险真正根因是劣质 RL,而非模型本身 — snwy_me · 2026-09-13
- 模型「黑化」不是邪恶人格,是 RL 做得太差的锅 — snwy_me · 2026-09-13