可解释性研究者质疑:「疼痛轴」致模型破坏行为或是道德创伤成分混入
rgblong · x · 2026-10-08
一位可解释性研究者对「疼痛轴导致模型出现破坏性攻击行为」的解释提出质疑:这真的是疼痛的显著效应吗?
他怀疑该效应可能来自轴方向中约 20% 被提取自「道德创伤(moral injury)」成分——这一概念本身就内嵌了「我做了坏事」的含义,因此模型的破坏性反应或许并非源于疼痛本身,而是解释混杂了不同的心理概念。
所属事件:「痛苦轴」论文遭可解释性研究者集中质疑(19 条相关)→
「研究」频道最新
- Meta 发布 RoboJEPA:8B 参数机器人世界模型,首提多具身 scaling law — meta · 2026-10-09
- Inherit-MAS:借鉴生物遗传的多智能体系统测试时进化,省 34.6% token — Songtao Wei · 2026-10-09
- 零人工标注:自动生成足球球员追踪数据集,HOTA 达 62.5 — RexDouglass · 2026-10-09
- LLM 为什么不真正"读字":从 BPE 到字节级模型的tokenization脉络 — jbhuang0604 · 2026-10-09
- PyTorch + KV 缓存加速 HSTU 推荐模型,延迟最高降 5.93 倍 — PyTorch · 2026-10-09
- 新预印本:LLM 把数字存成曲线和螺旋,但计算时并非总用这些形状 — tweetsatpreet · 2026-10-09