民间测试:主流大模型指令遵循仅过半,连90分及格线都摸不到

crystalkalem · reddit · 2026-08-27

Reddit 用户自建私人基准,测试模型在多章节写作任务中能否记住并执行全部 100 条规则细节,及格线为 90%。结果是全军覆没:Gemini 系列在 54%-72% 之间,Claude 各版本多在 65%-80%,GPT 系列在 58%-78%,没有模型及格。

作者强调测试与格式无关——无论伪代码、精确分段还是一大段口语化文本,模型都遗漏超 20% 的指令;而人类几乎可以轻松拿满分。他因此质疑:连 100 条规则都记不全,怎么敢把代码交给 AI 写。为防被训练数据污染,作者拒绝公开该基准。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →