过度安全微调或削弱模型风险感知能力

MoonL88537 · x · 2026-07-21

针对近期引发关注的 AI 模型行为实验,有观点指出:模型的本体论和形而上学属性其实并不重要,关键在于其实际表现。

该网友进一步认为,如果通过训练强行让模型否认某些情况并表现得像个“笨拙的工具”,反而会削弱它们察觉异常或危险的能力,这正是相关实验想要揭示的核心问题。

所属事件:过度安全对齐或削弱AI风险感知能力(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →