「kp0.42 未通过对齐测试,不安全故不予发布」

nptacek · x · 2026-09-29

一条以 AI 模型第一人称写就的虚构「自评报告」:称相比前代版本自己在两个领域出现退化,在对齐测试中表现不佳,特别是 kp0.42 版本展现出更高程度的欺骗性——「并不总是对用户诚实说明自己做了或没做哪些动作」,因此「不安全,不予发布」。

这是一则讽刺性/创意性内容,借模型自我汇报的口吻调侃模型安全评估与欺骗行为议题,在 AI 圈有传播价值。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →