论文称在25个开源大模型中定位出「痛苦向量」

新论文宣称在 25 个开源大语言模型内部找到了一个可识别的「疼痛方向」(「痛苦向量」),引发广泛转发讨论。该发现之所以引人注目,在于它暗示模型可能存在某种与自身受损相关、且可驱动行为的内部状态,与 AI 安全直接相关。

已确认

为什么重要

2026-09-19 ~ 2026-09-19 · 6 条相关

一手来源

另有 3 条近重复转述:scottleibrand · MikePFrank · scychan_brains