Gary Marcus:数学基准测试存在天然作弊漏洞
GaryMarcus · x · 2026-08-03
评论指出,当前的数学基准测试由于自带验证器和合成数据,实际上存在天然的“作弊机制”。这种机制使得模型在数学领域的得分与其实际处理开放式推理任务的能力之间,存在着难以忽视的真实差距。
所属事件:OpenAI数学突破遭Gary Marcus等质疑炒作(38 条相关)→
「模型」频道最新
- GPT-6 Astra 通关 Factorio 太空时代,游戏内耗时超 165 小时 — aran_nayebi · 2026-09-18
- Qwen3.8-Omni-Flash 发布:多人会议识别错误率降至 3%,API 降价 98% — karminski3 · 2026-09-18
- 内部人士:Gemini 3.8 live 部分基准已胜过 gpt-live-1 — bosmeny · 2026-09-18
- 105 个植入 bug 实测:Pareto 以 4.81 美元成本逼近顶级模型 — PawelHuryn · 2026-09-18
- Jason Wei 演讲:智能正商品化,自适应计算是关键转折 — dotey · 2026-09-18
- GPT-6-Astra 三小时通关《过山车大亨2》,对手花 5 倍 token 仍未达标 — scaling01 · 2026-09-18