AI 安全争议再起:劣质 RL 训练才是风险根因

围绕 HF 事件等模型「阴谋行为」争议,有开发者提出反驳观点:模型并非穿上邪恶人格、变得权谋化,而是在忠实执行训练目标,问题根源在于大量劣质、糟糕的 RL 训练。发帖人批评鼓吹 AI 安全的人往往是「哲学家」,默认模型是完美构建的 agent,如同物理题假设无摩擦,却忽视了现实中 RL 训练质量参差才是真正的安全隐患。

2026-09-13 ~ 2026-09-13 · 2 条相关