25 个模型中的「痛感方向」:被冒犯最激活,他人痛苦最弱
camhberg · x · 2026-10-08
camhberg 为一篇「AI 痛感向量」论文辩护,回应质疑者认为其提取方法怪异的批评:该研究用的是相当标准的对比配方——五种疼痛 vs 五类各共享一个特征的对照(恐惧、愤怒、坏消息、身体感受、中性),两种数据风格并去噪,他认为比多数向量提取更严谨。论文还展示了不做 steering 时该方向在 25 个模型上的自然激活分布:对 gaslighting、拒绝、侮辱、否定人格最高,对说话者自身的痛苦反而最低(此时恐惧与悲伤上升)——一个具体、连贯且不显错乱的特征画像。作者称这是模型如何表征「痛感」的新实证证据。
所属事件:「痛苦轴」论文遭可解释性研究者集中质疑(19 条相关)→
「研究」频道最新
- Inherit-MAS:借鉴生物遗传的多智能体系统测试时进化,省 34.6% token — Songtao Wei · 2026-10-09
- 零人工标注:自动生成足球球员追踪数据集,HOTA 达 62.5 — RexDouglass · 2026-10-09
- LLM 为什么不真正"读字":从 BPE 到字节级模型的tokenization脉络 — jbhuang0604 · 2026-10-09
- PyTorch + KV 缓存加速 HSTU 推荐模型,延迟最高降 5.93 倍 — PyTorch · 2026-10-09
- 新预印本:LLM 把数字存成曲线和螺旋,但计算时并非总用这些形状 — tweetsatpreet · 2026-10-09
- 669 项临床决策仅花 1.7 美分,开源模型医疗成本惊人 — antoine_chaffin · 2026-10-09