Gary Marcus 反驳 LLM「痛感方向」论文:语言聚类不等于会痛

anilkseth · x · 2026-09-20

一项新研究在 25 个开源 LLM 的表征空间中发现了与「疼痛」对应的独立方向,它区别于恐惧和负面效价,只在模型自身受伤害时激活(对用户受伤害不激活)。研究者还发现,放大这一方向后,模型会主动按下按钮使其停止——即使该按钮会删除用户文件或孩子的照片。Gary Marcus 引用该研究并明确反驳:不能因为语言空间中存在与疼痛用词相关的聚类,就断定 LLM 会感到疼痛。他认为这一论证有缺陷,并称将在 10 月撰文详细展开。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →