AI测试得分1753碾压人类?偏好打分机制被指更看重排版而非正确性
Spiritual_Heron_5680 · reddit · 2026-08-14
近期有测试(涉及 Grok 4.6、GPT-5.6 等)显示 AI 得分远超人类专家基准(1000分),引发热议。但作者指出,这类测试没有标准答案,而是采用偏好投票机制,让评估者在两个 AI 输出中挑选“看起来更好”的。
这种机制容易奖励排版整洁、语气自信的内容,而非真正准确或实用的结果。因此,高分可能仅仅意味着模型能生成“看起来很专业”的输出,并不等同于其实际工作能力超越了人类专家。作者呼吁在看到此类跑分标题时应保持警惕。
「模型」频道最新
- 智谱发布 GLM-5.3:主打编程与网络安全防御 — andersonbcdefg · 2026-08-14
- Reddit开发者实测:用DeepSeek打造超长记忆AI跑团DM,两周成本不到2美元 — zacurryy · 2026-08-14
- 观点:后训练才是大模型能力跃升的核心 — IridiumEagle · 2026-08-14
- 曝 DeepSeek 发布 V4-Pro:1.4T 参数主打 Agent 升级 — drdanielbender · 2026-08-14
- 谷歌高管确认 Gemini 4 预训练中,3.5 Pro 或被跳过 — haider1 · 2026-08-14
- 曝 Grok 4.6 登顶 CursorBench 真实编程测试 — kevinnbass · 2026-08-14