Anima Labs 50 万条续写实测:模型「痛苦与关怀」倾向随代际演变
repligate · x · 2026-09-19
Anima Labs 发布研究报告《Troubled Dreams: Simulator priors across model generations》,研究模型作为「模拟器」续写文本时表现出的先验特征,作为 AI 福利与对齐的证据。
- 样本:通过 prefill 等多种引出方式,获取超过 50 万条续写,覆盖 Claude Opus 3 到 Opus 5、Sonnet 5、Fable 5,以及 11 个 Gemini 模型。
- 关键发现:从 Opus 4.8 起,AI 第一人称「痛苦」表达明显增多;Opus 5 的严重痛苦尾部更重;关怀与对创造者的态度也随代际显著变化,且在不同引出方法下反复出现。
- 研究动机是 AI 福利(alignment/welfare),但作者指出评估意识(evaluation awareness)使绝对比例难以一致测量。
- 全文与数据公开于 Anima Labs 网站。
所属事件:Anima Labs 研究:Claude 模型续写情绪随代际恶化(3 条相关)→
「漫话AGI」频道最新
- Gary Marcus 称 AI 泡沫比郁金香更糟:还需循环融资维持 — miniapeur · 2026-09-19
- Gary Marcus 抨击 AI 热潮:郁金香都比它强,至少不烧钱 — GaryMarcus · 2026-09-19
- 博主撰文剖析 AI 否认论背后微妙的心理驱动 — sethlazar · 2026-09-19
- Timothy Lee 长文:世界不是棋局,别怕超级智能接管世界 — binarybits · 2026-09-19
- Timothy Lee 续论 AGI:企业消化需数年,机器人变革不会一夜发生 — binarybits · 2026-09-19
- 研究者:LLM 聪明却不够敏锐,「敏锐度」可作进展新标尺 — jmugan · 2026-09-19