随便问几句测不出模型实力:数据污染让「随手 prompt」结论不可靠

iamKierraD · x · 2026-09-21

Kevin Roose 认为「随机鹦鹉」和「全是营销炒作」两种论调早在 2023 年前后就已被证伪,很多人(包括一些 AI 记者)出于恐惧、傲慢或公司 IT 政策从未真正用过 AI 工具,是「文明级的损失」。

Chomba Bupe 则反驳:普通用户靠随手写 prompt 也未必能对模型能力形成可靠判断——因为「用几个设计糟糕的 prompt 就能测出模型上限」的说法完全没考虑数据污染问题,评测集内容可能早已进入训练数据。两条观点合起来指向同一个结论:无论吹还是黑,认真、设计良好的实测才是判断 AI 能力的唯一途径。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →