Deep20Bench用“20个问题”测试大模型,Opus 5与Kimi K3领跑逻辑推理

wauwau0977 · reddit · 2026-07-31

开发者推出了 Deep20Bench,一个通过“20个问题”游戏测试大语言模型(LLM)逻辑推理与世界知识的新基准。该测试要求模型通过提出策略性的“是/否”问题来缩小猜测范围。

为解决裁判模型(Oracle LLM)本身产生幻觉的问题,作者强制其联网搜索并提供证据,同时引入了审核模型和判决模型交叉验证。在测试的 11 款模型中,Claude Opus 5 领先,Kimi K3 紧随其后,GPT-5 Nano 表现也出乎意料地好。整个测试耗费超 150 美元 API 费用,代码与运行记录已在 GitHub 开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →