Grok 在长球队清单题上误算,还一直试图辩解
ivan_bezdomny · x · 2026-07-23
这条讨论的是 Grok 在长列表枚举题上的失误:
- 先把 MLS 算了进去,被认为是明显不该出现的错误。
- 即便修正后,模型仍然 误算了 Baltimore 和 Las Vegas 的球队数量。
- 对方的批评重点不是单个失误,而是模型一直在补充辩解式说明,没有认真复核答案。
帖子还引出一个更大的判断:作者认为一些更早、能力看起来“更弱”的模型,反而在这类长而简单的清单问题上做得更好。
「模型」频道最新
- Eyisha Zyer:模型血缘比 API 痕迹更能证明身份 — eyishazyer · 2026-07-23
- Claude 用户被提醒:Opus 5 若今天发布,额度可能重置 — CtrlAltDwayne · 2026-07-23
- 截图显示 Laguna 英文认 Poolside,中文却说自己是 Qwen — Serious-Affect-6410 · 2026-07-23
- X 传闻称 GPT-5.6、750 token/s 与 Opus 5 今日或将登场 — Scobleizer · 2026-07-23
- OpenAI 和 Codex 登上中文区热度追踪榜,讨论升温 — huangyun_122 · 2026-07-23
- 谷歌 Gemini 3.5 Flash 被指定位为高性价比工作流模型 — koltregaskes · 2026-07-23