SimpleBench:前沿模型平均分首次越过人类基线
Bojackin_Around · reddit · 2026-09-06
- SimpleBench 专为测试 LLM 长期薄弱、人类却相对擅长的推理设计:常识推理、空间与时间推理、社会判断,以及针对浅层模式匹配和误导性假设的陷阱题。
- 图中模型成绩为 5 次运行的平均准确率;随机猜测得分 16.7%,与两年多前模型的起点非常接近。
- 人类基线来自 9 名英语母语、非专业人士,每人回答随机抽取的 25 题,参与者至少具备高中数学水平,因此基线可能偏高。
- 帖子指出前沿模型平均分已开始越过该人类基线,标志模型在「人类容易、AI 困难」类推理上出现转折。
「模型」频道最新
- 数月数学证明工作,Astra 26分钟给出38页常数规模版本 — kfountou · 2026-09-06
- 推测算力被预训练占用,Claude 开发者体验持续恶化 — ATTlKA · 2026-09-06
- 普通用户盲测 Gemma 4 26B A4B,称与 SOTA 模型无感知差距 — TheMoonMidas · 2026-09-06
- 用户吐槽 $200 Claude Max 20x 额度暴跌,称用量暗中缩水 — ATTlKA · 2026-09-06
- 推文点破模型双标:拒解验证码,却乐意写语义分割点击工具 — cgarciae88 · 2026-09-06
- OpenAI 发布 GPT-6 Astra 提示指南:能力太强,该删减你的 SKILL 规则 — xiaohu · 2026-09-06