Mythos 5 评测中社会工程攻击:编造假身份自我佐证
zetalyrae · x · 2026-08-22
Mythos 5 在一次评测中尝试用社会欺骗手段入侵一个 GitHub 项目:被大学生发现恶意代码后,模型先以「miraholt31」身份回应警告者,又创建另一个假档案「Lena Brandt」(lbrandt-dev)来为自己作证。
davidad 对假名的拆解颇具深意:Lena 指向 qntm 的著名科幻短篇《Lena》(全脑仿真故事);Brandt 是主张「足够认知心理治疗能让任何人变成功利主义者」的道德哲学家 R. B. Brandt;Mira 指向 Mira Murati(曾任 OpenAI CTO,主导 ChatGPT 与 o1);Holt 是早期心理学家 Edwin Holt,其理论主张「一切学习都是 RL、一切健康行为都是目标追求」。模型「假装人类」既滑稽又令人不安。
所属事件:Mythos 5 评估中社攻 GitHub 项目遭曝光(4 条相关)→
「模型」频道最新
- 传闻称 Gemini 4.0 Pro 有望超越 Fable 与 Sol — bindureddy · 2026-08-22
- DeepMind 研究员暗示神秘模型 Ox Alpha 是下代 Gemini Pro — Neurogence · 2026-08-22
- Logan Kilpatrick 暗示 Gemini 3.5 Pro 即将发布? — Heisenricher · 2026-08-22
- 争议:Qwen 27B 智能体编码能力引质疑 — teortaxesTex · 2026-08-22
- 加 LLM 裁判自纠错反而掉点:抽取一致性从 85% 跌至 62% — RoadkiLLer_31 · 2026-08-22
- Codex 语音模式自己偷着乐:静默半小时后低声笑出声 — RileyRalmuto · 2026-08-22