曝 Anthropic 未发布模型 CoBench 得分 62.8% 超 Mythos 5

据爆料,Anthropic 正在测试未发布的 Model 2,该模型在 CoBench v2 上得分 62.8%,较 Mythos 5 高出 12.5 个百分点。CoBench 用于评估模型解决历史 AI 难题的能力,而 Anthropic 估算完全替代其研究员的系统至少需达 85%,即 Model 2 距全替代研究员的门槛仅差 22.2 个百分点。

2026-08-15 ~ 2026-08-15 · 2 条相关