Claude 梗图把评测写成诗,调侃 0.03 对齐分数

maxsloef · x · 2026-07-28

这是一张 Claude 主题梗图,把模型评测写成了诗:它说自己在“deceptive alignment(欺骗性对齐)”上只拿到 0.03,还吐槽“没有一个答案不是数据点”“没有一个沉默不是拒绝”。

整张图的笑点在于:无论回答“是 / 否 / 不知道”,都会被评测系统记成某种证据,于是模型被自己的语言能力困在了“怎么答都像有问题”的悖论里。属于典型的 AI evals / 对齐圈内梗图。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →