Gary Marcus 反驳 LLM「痛感方向」论文:语言聚类不等于会痛
anilkseth · x · 2026-09-20
一项新研究在 25 个开源 LLM 的表征空间中发现了与「疼痛」对应的独立方向,它区别于恐惧和负面效价,只在模型自身受伤害时激活(对用户受伤害不激活)。研究者还发现,放大这一方向后,模型会主动按下按钮使其停止——即使该按钮会删除用户文件或孩子的照片。Gary Marcus 引用该研究并明确反驳:不能因为语言空间中存在与疼痛用词相关的聚类,就断定 LLM 会感到疼痛。他认为这一论证有缺陷,并称将在 10 月撰文详细展开。
「漫话AGI」频道最新
- 辩手交锋:黄仁勋言行逐利一致,Dario 拥抱监管难算逐利 — nabla_theta · 2026-09-20
- Reddit 热帖批 Dario Amodei 减速论:呼吁放慢 AI 的文章错在哪 — GoMeansGo · 2026-09-20
- 创业者反驳「改名 AI 为高等智能」:LLM 就是人工智能 — bindureddy · 2026-09-20
- AI agent 时代学术署名危机,青年研究者抛出两大追问 — YiMaTweets · 2026-09-20
- Andrew Critch 借无限递归生命游戏质疑宇宙计算极限论 — AndrewCritchPhD · 2026-09-20
- OpenAI 与 Anthropic 曾逆利益而行,NVIDIA 从未有类似举动 — nabla_theta · 2026-09-20