Frontier-Bench 比 Terminal-Bench 更能区分前沿模型
JJitsev · x · 2026-07-25
Frontier-Bench 被认为比 Terminal-Bench v2.1 更能区分前沿模型和次前沿模型。
帖子举了一个例子:Claude Code 里的 Fable 5 和 Claude Code 里的 Opus 4.8 在 Terminal-Bench v2.1 上只差 4.9%,但在 Frontier-Bench v0.1 上差距扩大到 12.7%,说明新基准的区分度更强。
「模型」频道最新
- Anthropic 称 Opus 5 以半价逼近 Fable 5 基准表现 — dotey · 2026-07-25
- Opus 5 价格涨约 15%,但仍被视为 4.8 的严格升级 — bindureddy · 2026-07-25
- Fable 5.1 预计晚于 GPT-6,发布时间指向 8 月下旬到 9 月中旬 — zephyr_z9 · 2026-07-25
- ARC-AGI-3 图表显示 Opus 5 领先,但评测成本更高 — Angaisb_ · 2026-07-25
- Opus 5 比 4.8 明显更强,但“灵光”仍不如 Fable 5 — bindureddy · 2026-07-25
- 一张首发图把 53.4 画得像比 53.5 更强 — op7418 · 2026-07-25