Frontier-Bench 比 Terminal-Bench 更能区分前沿模型

JJitsev · x · 2026-07-25

Frontier-Bench 被认为比 Terminal-Bench v2.1 更能区分前沿模型和次前沿模型。

帖子举了一个例子:Claude Code 里的 Fable 5 和 Claude Code 里的 Opus 4.8 在 Terminal-Bench v2.1 上只差 4.9%,但在 Frontier-Bench v0.1 上差距扩大到 12.7%,说明新基准的区分度更强。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →