Claude Fable 5 刷新 WeirdML 纪录
scaling01 · x · 2026-07-12
Claude Fable 5(max)在 WeirdML 上拿到 91.9%,刷新新的最佳成绩。
要点:
- 如果按每个任务的历史最优分数拼出理论 SOTA,总分会是 93.5%,说明 Fable 5 在单次运行里通常都能贴近各任务最优水平。
- 它在 17 个任务里有 7 个任务达到 SOTA。
- 最差的一次运行也只比对应 SOTA 低 7%。
- 这次每个任务只跑了 2 次,比常见的 5 次更少,所以这个结果更显得强,但也意味着更容易避开一两个坏样本。
「模型」频道最新
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11