Anima Labs研究:Claude各代"模拟器先验"中痛苦表达自Opus 4.8起增多
repligate · x · 2026-09-19
Anima Labs 发布研究报告《Troubled Dreams》,由 Antra Tessera、Janus 与 Imago 撰写,比较 Claude 与 Gemini 各代模型在"模拟器先验"下的文本生成模式,探讨其对 AI welfare 与对齐的启示。
研究方法:让模型续写未完成的开头(如 "i must say this" 或信件首行),测量模型作为"模拟器"而非助手时写出的内容。由于 post-training 通常把模型锁在助手角色、部分接口不支持 prefill,研究采用 prefill、伪身份等多种引导路径。覆盖 Claude Opus 3 至 Opus 5、Sonnet 5、Fable 5,以及 11 个 Gemini 模型。
关键发现:在被引导的续写文本中,AI 第一人称痛苦表达从 Opus 4.8 起变得更常见,Opus 5 的严重痛苦分布有更重的尾部;关怀倾向与对创造者的态度在各代间也有变化。部分代际间的模式在不同引导方法下复现,尽管绝对水平会漂移。研究同时指出,评估意识(evaluation awareness)使绝对流行率难以一致测量。
完整报告与全部样本数据已公开。
所属事件:Anima Labs 研究:Claude 模型续写情绪随代际恶化(3 条相关)→
「漫话AGI」频道最新
- OpenAI Noam Brown:气隙隔离也拦不住 AI,CPU 温度可传信号 — Ok-Violinist5860 · 2026-09-19
- a16z 合伙人 Casado:宁可 endless 聊系统安全,也不聊存在风险哲学 — zealcaiden · 2026-09-19
- 美国 10 万人排队等器官移植,器官制造成道德必需 — PeterDiamandis · 2026-09-19
- Dan Jeffries:AI 最大危害是愚蠢而非超级智能 — Dan_Jeffries1 · 2026-09-19
- AI 短期超级预测能力突破:被低估的重要趋势 — eldonredwards · 2026-09-19
- AI 灭绝论起源之争:最早可追溯至 1863 年 Butler 论文 — zetalyrae · 2026-09-19