AI 味盲测细节:人作 0 次胜出,30% 判定因顺序翻转作废
PawelHuryn · x · 2026-09-07
- Pawel Huryn 补充盲测细节:3 个任务限 500 词内;人类对照用 LinkedIn 任务,把自己的 15 篇 2021-2022 年(ChatGPT 出现前)旧帖与各模型输出按同样规则对比,360 次判定中模型被选 355 次、人作 0 次、5 次翻转——结果反常到连作者自己都不舒服。
- 翻转(评审在交换顺序后改变选择)占全部判定的 30%,一律作废;两位评审看到同一对并都坚持判断时,一致率达 89%-97%。
- 作者承认无法完全控制的一点:xAI API 会注入隐藏 system prompt,Grok 是唯一没跑在空 system prompt 上的模型。
所属事件:12 模型「AI 味」盲测:Gemini 3.8 最易露馅(3 条相关)→
「模型」频道最新
- 博主估算训练数据规模应为 5-7T,认为 8T 已属高估 — scaling01 · 2026-09-07
- 数学家指责 OpenAI Astra 十项数学成果涉研究不端:未引用已有文献 — asusarla · 2026-09-07
- Peter Gostev 辨析模型稀疏度爆料:Kimi 26:1、DeepSeek 32:1,1.2T 激活参数不可信 — inductionheads · 2026-09-07
- OpenAI 新模型在旧 Chat Completions 接口禁用 function tools,迁移二选一 — AI-Specialist-6597 · 2026-09-07
- 开发者实测:Astra 擅长自主目标推进,指令遵循却不及 Sol — MinqiJiang · 2026-09-07
- 美国政府正以 1 美元价格使用三大模型,合同本月到期存续未知 — LuizaJarovsky · 2026-09-07