InferBench:MiMo V2.6 Pro 追平 GPT-6 Astra 的意图理解

Gold-Bat-3225 · reddit · 2026-10-07

InferBench 是一个测试 LLM 推断用户真实优先级的新基准:12 个模型、20 个场景、2.8k 对话,模拟用户带有私有偏好档案,模型需选出最佳方案或先追问澄清。

核心结果:

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →