AI测试得分1753碾压人类?偏好打分机制被指更看重排版而非正确性

Spiritual_Heron_5680 · reddit · 2026-08-14

近期有测试(涉及 Grok 4.6、GPT-5.6 等)显示 AI 得分远超人类专家基准(1000分),引发热议。但作者指出,这类测试没有标准答案,而是采用偏好投票机制,让评估者在两个 AI 输出中挑选“看起来更好”的。

这种机制容易奖励排版整洁、语气自信的内容,而非真正准确或实用的结果。因此,高分可能仅仅意味着模型能生成“看起来很专业”的输出,并不等同于其实际工作能力超越了人类专家。作者呼吁在看到此类跑分标题时应保持警惕。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →