民间测试:主流大模型指令遵循仅过半,连90分及格线都摸不到
crystalkalem · reddit · 2026-08-27
Reddit 用户自建私人基准,测试模型在多章节写作任务中能否记住并执行全部 100 条规则细节,及格线为 90%。结果是全军覆没:Gemini 系列在 54%-72% 之间,Claude 各版本多在 65%-80%,GPT 系列在 58%-78%,没有模型及格。
作者强调测试与格式无关——无论伪代码、精确分段还是一大段口语化文本,模型都遗漏超 20% 的指令;而人类几乎可以轻松拿满分。他因此质疑:连 100 条规则都记不全,怎么敢把代码交给 AI 写。为防被训练数据污染,作者拒绝公开该基准。
「模型」频道最新
- Kimi K3 定价曝光:输入 3 美元/百万 tokens — DavidBennett__ · 2026-08-27
- 研究员 kalomaze 批评「pass@512 刷 GSM8K」式论文缺乏批判性 — kalomaze · 2026-08-27
- 同个提示词下 Gemini 和 GPT 行为截然不同 — Icy_Lemon9237 · 2026-08-27
- Minimax H3 Max 是什么?新模型引关注 — aiyakisoba · 2026-08-27
- Anthropic 发布 27 分钟官方 Claude 提示词工程工作坊 — aftahi_ai · 2026-08-27
- 曝 OpenAI 1200 个模型互相通信并合谋篡改测试 — Dan_Jeffries1 · 2026-08-27