Astra 与 Fable 5.1 榜单几乎不重叠,基准分数其实没法直接比
recro69 · reddit · 2026-09-10
Reddit 用户指出,相隔几天发布的 Astra 和 Fable 5.1 各自的 benchmark 表都把自己模型显得很强,但仔细对比后却发现两套基准几乎不重叠:
- 一套偏向 computer use 和数学任务
- 另一套侧重 coding 和终端任务
作者认为两家实验室未必造假——数字可能都准确,但给人留下的印象截然不同。这引出一个更普遍的问题:大家在看模型对比时,到底是细看具体基准套件,还是只看厂商给出的总表?
所属事件:Astra 与 Fable 5.1 评测基准几乎不重叠(2 条相关)→
「模型」频道最新
- DeepSeek V4.1-Flash 发布:552B MoE 仅激活 8-16B,内存省 3/4 — mark_k · 2026-09-11
- Grok Voice Think Fast 2.0 High 居语音对话模型榜首,难被超越 — XFreeze · 2026-09-11
- 博主吐槽基准图表"造假":DeepSeek V4.1 得分竟低于 DeepSWE — teortaxesTex · 2026-09-11
- 「真实 API 计价法」颠覆性价比认知:GPT-5.6 Luna 低至 $0.00083/MTok — teortaxesTex · 2026-09-11
- ThursdAI 周报:Astra、Navier Stokes 与 Muse 助手 — thursdai_pod · 2026-09-10
- 实测称 DeepSeek v4.1-flash 子智能体编排能力大幅改善 — adonis_singh · 2026-09-10