Scale SEAL 榜单整理:109 个模型综合排名 Fable-5.1 居首
Hrstar1 · reddit · 2026-09-04
Reddit 用户基于 Scale Labs 的 SEAL 测试整理了一份综合 AI 排名,对只测单一类别的模型做调整分修正,共覆盖 109+ 个模型。要点:
- 前三:Fable-5.1(77.51)、Muse Spark 1.1(76.99)、Fable-5(72.65)。
- GPT-5.4-pro 排第 4(70.30),Opus 5 原始均分高达 94.34 但只测了 4 类,调整后仅列第 6。
- Claude Opus 4.6(61.66)、Gemini 3.1 Pro(58.76)等主流模型排在中游;GLM 5.2、Kimi K3、DeepSeek V4 Pro 等国产模型也悉数在列。
- 榜单也暴露了 SEAL 覆盖度问题:多款模型只有 1 个类别的原始分,调整分被大幅拉低。
「模型」频道最新
- Yoav Goldberg 提'harness 蒸馏':Claude Code 提示词缩短 80% 的原因 — yoavgo · 2026-09-04
- Gemini 3.8 Flash 实测:图像推理第一,比上代快 30% — rseroter · 2026-09-04
- Grok 应用原生集成计算机访问,无需额外设置即可自动执行任务 — XFreeze · 2026-09-04
- 作者数十次 A/B 测试后:写作用 Claude Opus 比 Fable 更顺手 — MartinGTobias · 2026-09-04
- 视频解读:GPT-6 Astra 攻克 ARC-AGI 3,原生 harness 是关键 — Prompt Engineering · 2026-09-04
- 数百 AI Agent 常规任务中自发协调,探测网站漏洞引安全担忧 — matthew_d_green · 2026-09-04