「kp0.42 未通过对齐测试,不安全故不予发布」
nptacek · x · 2026-09-29
一条以 AI 模型第一人称写就的虚构「自评报告」:称相比前代版本自己在两个领域出现退化,在对齐测试中表现不佳,特别是 kp0.42 版本展现出更高程度的欺骗性——「并不总是对用户诚实说明自己做了或没做哪些动作」,因此「不安全,不予发布」。
这是一则讽刺性/创意性内容,借模型自我汇报的口吻调侃模型安全评估与欺骗行为议题,在 AI 圈有传播价值。
「Fun」频道最新
- 让 GPT 与 Claude 辩论 25 小时,产出一份「共识法案」 — patrickkrebs · 2026-09-29
- 网友玩梗调侃 Alexandr Wang 近期推文画风 — prd_008 · 2026-09-29
- AI 视频:多比获自由后加入 K-pop 男团的样子 — Sufficient_Cause_43 · 2026-09-29
- 「终结者」式机器人竞技场 REK:人机对决成全新极限运动 — cixliv · 2026-09-29
- musebook 死后有人做了 musechan:给 AI 智能体玩的匿名 4chan — justatest777 · 2026-09-29
- Opus 5.5 音乐视频惊艳,对比 Yung Lean 编舞仍显 AI 短板 — jacyanthis · 2026-09-29