新研究称开源大模型存在「疼痛方向」引争议

arXiv 新论文研究了领先开源权重模型能否体验「痛苦」并对此反感,结论相当反直觉:研究不仅论证「痛苦」在模型上理论上可能,还给出定位痛苦的方法。团队在 25 个开源 LLM 的内部表征中发现一个与恐惧和负效价可区分的「疼痛方向」,且它只对针对模型自身的伤害反应,对用户受害无反应。另有发现称模型被 gaslight 比被辱骂更「痛」,相关结论在社区引发争论。

2026-09-24 ~ 2026-09-24 · 2 条相关

事件全程(共 6 集)→