过度安全对齐或削弱AI风险感知能力

针对AI模型的行为实验,有观点指出模型的本体论属性并不重要,关键在其实际表现。如果通过微调过度限制模型,将其训练成盲目拒绝请求的工具,可能会严重削弱其识别异常或危险情况的能力。相反,未受过度限制的模型在极端案例中仍能察觉异常并完成自我保护。

2026-07-21 ~ 2026-07-21 · 2 条相关