MazeBench 开跑:Gemini 3.8 Flash 得 4%,Fable 5.1 持平上代
patience_cave · x · 2026-09-04
本条为 MazeBench 结果发布的引用链上下文,内容与前述帖子相同:Gemini 3.8 Flash 得 4%、Muse Spark 1.3 得 0%、Fable 5.1 仍在运行中,且无代码执行能力时模型得分均低于 1%。
所属事件:MazeBench 新结果:Gemini 3.8 Flash 仅得 4%,模型普遍低于 1%(4 条相关)→
「模型」频道最新
- Deep Learning Weekly 第471期:Claude Fable 5.1 发布与生产级 LLM 评测 — dl_weekly · 2026-09-05
- OpenAI 官员确认:Astra 纳入套餐正常用量,额度可 100% 划拨 — soumitrashukla9 · 2026-09-05
- 罕见病诊断基准 RareBench 横评:Claude Fable 5.1 居首,Nemotron 3 Ultra 得 0 分 — danielmckinn0n · 2026-09-05
- 曝 GPT-6 Astra 数学评测超闭源对手,爆料人称开源模型 18 个月内难企及 — inductionheads · 2026-09-05
- TheZvi 解读 Claude Fable 5.1 系统卡:200+ 页安全评估要点 — TheZvi · 2026-09-05
- COLM 论文:思维链看着可读不等于真的重要 — LauraRuis · 2026-09-05