新论文:在25个开源LLM中发现与恐惧独立的「疼痛方向」

repligate · x · 2026-09-20

一篇新论文宣称在 25 个开源 LLM 中找到了「疼痛方向」(pain direction):

这项可解释性研究对模型福祉(model welfare)与对齐讨论有直接含义,作者还发布了附带的分析线程。

所属事件:研究发现25个开源LLM存在「疼痛方向」,为止痛愿越安全底线(12 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →