Anthropic 内部基准:替代研究员需 85% 得分,Fable 5.1 还差得远
haider1 · x · 2026-09-02
据泄露/流传的 Anthropic 内部评测信息,Mythos 5.1 在公司内部的"真实研发(real R&D)"基准上得分略低于 Opus 5、高于 Mythos 5。
Anthropic 认为,一个模型需要达到 85% 的分数才能真正替代其研究员工——而 Mythos 5.1 距离这一门槛仍有明显差距。这为「前沿模型离替代 AI 研究员还有多远」提供了一个罕见的内部量化参照。
「模型」频道最新
- RWKV-7 G1j 发布:纯 RNN 架构在 agent 与编码任务大幅增强 — jeremyphoward · 2026-09-02
- Fable 5.1 三十分钟一次成型可用的吉他 VST 插件 — CtrlAltDwayne · 2026-09-02
- Fable 5.1 自选目标解开 373 年历史密码 — rickasaurus · 2026-09-02
- Fable 5.1 模型展示:单次生成的高质量角色渲染 — TAbrodi · 2026-09-02
- Anthropic 安全机制误判:Fable 5.1 测试遭拦截 — GregKamradt · 2026-09-02
- OpenAI 重启大型前沿 RL 训练,Astra 实测获满分 — haider1 · 2026-09-02