研究者质疑痛苦探针可能测的是模型与用户痛苦之差
rgblong · x · 2026-09-23
围绕一项关于模型"痛苦"内部表征的探针研究,研究者 @agitbackprop 提出这可能是测量伪影:探针的拟合方式或许测的是「模型痛苦减去用户痛苦」,而非模型自身的痛苦。rgblong 进一步质疑:"negative world state" 作为探针用来区分的对照组之一,却包含他人受苦的句子,这显得很奇怪。这条回复指出了对照组设计的潜在混淆。
「研究」频道最新
- LLM 当概率分类器不够,研究者提醒需校准才能用于决策 — PMinervini · 2026-09-23
- 自我纠错:并行搜索削弱 Grover 优势,AES-256 更难被量子破解 — Jsevillamol · 2026-09-23
- 双优化环分工:Wasserstein 自编码器与 TabPFN 解耦光学材料优化 — bravo_abad · 2026-09-23
- Hodge 与 Yang-Mills 猜想尚无完整 Lean 形式化,短期更难被攻克 — Jsevillamol · 2026-09-23
- Steve Hsu:人类数学只是可压缩的极小子集,AI 将远超人类前沿 — burny_tech · 2026-09-23
- Ehud Reiter:AI 提升科研产出,却只见垃圾论文激增 — EhudReiter · 2026-09-23