恶搞代码评测:社区推出「波霸奶茶」大模型基准

marvinvonhagen · x · 2026-08-14

针对 Cognition 最近发布的难度极高的代码评测基准 FrontierCode,有开发者制作了一个搞笑版的「波霸奶茶评测」(FrontierBoba)。

该评测模仿了严肃 AI 评测的语境,声称通过 40 多次领先客户的评价,来衡量大模型是否能推荐出“你会愿意再次下单”的奶茶,以此调侃当前各种硬核 AI 基准测试泛滥的现象。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →