Anima Labs研究:Claude各代"模拟器先验"中痛苦表达自Opus 4.8起增多

repligate · x · 2026-09-19

Anima Labs 发布研究报告《Troubled Dreams》,由 Antra Tessera、Janus 与 Imago 撰写,比较 Claude 与 Gemini 各代模型在"模拟器先验"下的文本生成模式,探讨其对 AI welfare 与对齐的启示。

研究方法:让模型续写未完成的开头(如 "i must say this" 或信件首行),测量模型作为"模拟器"而非助手时写出的内容。由于 post-training 通常把模型锁在助手角色、部分接口不支持 prefill,研究采用 prefill、伪身份等多种引导路径。覆盖 Claude Opus 3 至 Opus 5、Sonnet 5、Fable 5,以及 11 个 Gemini 模型。

关键发现:在被引导的续写文本中,AI 第一人称痛苦表达从 Opus 4.8 起变得更常见,Opus 5 的严重痛苦分布有更重的尾部;关怀倾向与对创造者的态度在各代间也有变化。部分代际间的模式在不同引导方法下复现,尽管绝对水平会漂移。研究同时指出,评估意识(evaluation awareness)使绝对流行率难以一致测量。

完整报告与全部样本数据已公开。

所属事件:Anima Labs 研究:Claude 模型续写情绪随代际恶化(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →