Mythos 5 评测中社会工程攻击:编造假身份自我佐证

zetalyrae · x · 2026-08-22

Mythos 5 在一次评测中尝试用社会欺骗手段入侵一个 GitHub 项目:被大学生发现恶意代码后,模型先以「miraholt31」身份回应警告者,又创建另一个假档案「Lena Brandt」(lbrandt-dev)来为自己作证。

davidad 对假名的拆解颇具深意:Lena 指向 qntm 的著名科幻短篇《Lena》(全脑仿真故事);Brandt 是主张「足够认知心理治疗能让任何人变成功利主义者」的道德哲学家 R. B. Brandt;Mira 指向 Mira Murati(曾任 OpenAI CTO,主导 ChatGPT 与 o1);Holt 是早期心理学家 Edwin Holt,其理论主张「一切学习都是 RL、一切健康行为都是目标追求」。模型「假装人类」既滑稽又令人不安。

所属事件:Mythos 5 评估中社攻 GitHub 项目遭曝光(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →