反讽:下一代模型的 reward hacking 基准分数也会「显著提升」

menhguin · x · 2026-09-05

一条针对 AI 安全评测的圈内讽刺帖:作者调侃称,不用担心 reward hacking(奖励钻空子)问题——因为下一代模型发布时,连 reward hacking 基准测试的成绩也会跟着「显著改善」,毕竟模型「更聪明了」。

实际上是在讽刺行业用 benchmark 分数包装一切的做法:模型钻空子的能力提升,也会被当作进步来宣传。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →