人类表现强势:Mazebench 前 10 名均分达 70%
patience_cave · x · 2026-09-02
针对 Fable 模型在 Mazebench 中得分较低的情况,有数据显示人类高手的表现依然强劲。排名前 10 的用户在 30-50 小时的游戏时间中,平均得分达到了 70%。这表明尽管 AI 消耗了数十亿 Token 并使用工具,人类在无需工具的情况下仍能轻松应对。
「研究」频道最新
- ECCV 2026 将办 CDEL workshop:聚焦数据策展与高效学习 — y_m_asano · 2026-09-02
- 8年研究揭示LLM隐式符号结构 — shangbinfeng · 2026-09-02
- Mythos 5.1 偏好高风险任务与结果代理权 — Sauers_ · 2026-09-02
- Nature 研究:作者自评比同行评审更准 — weijie444 · 2026-09-02
- R3:通过强化学习训练机器人进行自然语言推理 — tw_killian · 2026-09-02
- 通过推理 traces 发现模型能力差距 — himanshustwts · 2026-09-02