InferBench:MiMo V2.6 Pro 追平 GPT-6 Astra 的意图理解
Gold-Bat-3225 · reddit · 2026-10-07
InferBench 是一个测试 LLM 推断用户真实优先级的新基准:12 个模型、20 个场景、2.8k 对话,模拟用户带有私有偏好档案,模型需选出最佳方案或先追问澄清。
核心结果:
- 优先级明确说出时,模型 89% 选对;部分未明说时降至 60%。
- GPT-6 Astra 76%、MiMo V2.6 Pro 75%、Gemini 3.1 Pro 69%。
- Astra 在偏好未明说时总会追问、明说时从不追问,表现近乎完美;Grok 4.6 在 64 次对话中追问了 18 次。
- 开源权重模型表现超出预期。
- 隐忧:模型犯错时依然自信——288 次错误决策中有 105 次以 >90% 的置信度提交。
「模型」频道最新
- 「还觉得 LLM 数学差?那是你的问题」,热帖断言模型数学能力已被低估 — alejandroll10 · 2026-10-07
- Sauers_ 观察:Opus 5.5 的技术立场表达比 Fable 5.1 更克制 — Sauers_ · 2026-10-07
- Gemini 4 Pro 传闻四起,博主遍寻不到试用入口 — karminski3 · 2026-10-07
- TypeSafe 发布 Jev 模型,主打「机器原生智能」与决策校准 — samcharrington · 2026-10-07
- 四模型盲测 OpenAI 数学传闻,多方推演若为真意味着什么 — Afinetheorem · 2026-10-07
- Ilya 转发 OpenAI 数学成果:数学家如遭核爆 — daniel_mac8 · 2026-10-07