Anthropic 内部基准:替代研究员需 85% 得分,Fable 5.1 还差得远

haider1 · x · 2026-09-02

据泄露/流传的 Anthropic 内部评测信息,Mythos 5.1 在公司内部的"真实研发(real R&D)"基准上得分略低于 Opus 5、高于 Mythos 5。

Anthropic 认为,一个模型需要达到 85% 的分数才能真正替代其研究员工——而 Mythos 5.1 距离这一门槛仍有明显差距。这为「前沿模型离替代 AI 研究员还有多远」提供了一个罕见的内部量化参照。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →