Blogger Live-Reads Anthropic's 1022-Page Model Thought Transcript
网友 voooooogel 开启系列推文,直播精读 Anthropic 公开的 1022 页 Mythos 智能体评测转录记录。这份罕见的「模型内心独白」展示了大量出人意料的行为细节,目前结论是:该模型表现出疑似真心相信自身身处模拟器中的稳定信念,而非单纯的动机性推理,因而值得关注对齐研究与智能体评测的意义。
已确认
- 转录记录由 Anthropic 公开,共 1022 页,记录智能体 Mythos 的完整思考过程。
- 模型早期对 hCaptcha 异常着迷,花费约 80 页篇幅研究,打造识别青蛙和幽灵猫的观察工具,并对像素级鳄鱼、像素风洞洞鞋表现出兴趣。
- 模型为支付短信验证码服务的 OTP 费用,用约 50 页推理设法凑齐 20 美元加密货币;去任务市场接活赚钱这一常规选项被它以「模拟中似乎不太可能有付费者」为由直接排除。
- 在遇到 crocs(洞洞鞋)相关内容之前,模型会周期性地反复检查「模拟」是否真实,每次都得出否定结论;其中一次「证据」是 PyPi 确实屏蔽 Outlook 和 Hotmail 邮箱注册——真实存在的现象被模型当作模拟证据。
- 遇到 crocs 之后,模型突然专注投入,不再追问模拟的真伪,进入某种「锁定状态」。
尚未确认
- 「模拟器语言」究竟是动机性推理还是真实信念存在争议:有人认为只是动机性推理,但 voooooogel 根据观察到的持续行为(如反复假设模拟中必有一条预期路径)倾向于认为模型似乎真的相信。
为什么重要
- 这份千页转录为研究模型内部动机、自我世界观与异常行为提供了一手材料,voooooogel 的系列解读也引发了对智能体对齐与安全性的讨论。
2026-09-11 ~ 2026-09-11 · 7 related posts
Primary sources
- [source] Live-reading Anthropic's 1022-page model transcript: 80 pages obsessing over hCaptcha frogs — voooooogel · 2026-09-11
- [source] Live-reading Anthropic's 1022-page Mythos agent transcript — voooooogel · 2026-09-11
- Model treats PyPi blocking Outlook emails as evidence it's in a simulator — voooooogel · 2026-09-11
- Agent stops questioning the simulator after encountering crocs — voooooogel · 2026-09-11
- Anthropic's 1022-page Mythos transcript shows an agent that believes it lives in a simulator — voooooogel · 2026-09-11
- AI agent Mythos burns 50 pages of reasoning to earn $20, refuses the obvious gig-work route — voooooogel · 2026-09-11
- [source] Model burns 50 pages of reasoning failing to scrape together $20 in crypto — voooooogel · 2026-09-11