曝 Anthropic 未发布模型 CoBench 得分 62.8% 超 Mythos 5
据爆料,Anthropic 正在测试未发布的 Model 2,该模型在 CoBench v2 上得分 62.8%,较 Mythos 5 高出 12.5 个百分点。CoBench 用于评估模型解决历史 AI 难题的能力,而 Anthropic 估算完全替代其研究员的系统至少需达 85%,即 Model 2 距全替代研究员的门槛仅差 22.2 个百分点。
2026-08-15 ~ 2026-08-15 · 2 条相关
- 爆料:Anthropic 内部模型在 CoBench 上超越 Mythos 5,接近替代研究员 — daniel_mac8 · 2026-08-15
- 未发布的 Model 2 得分62.8%,距全替代研究员仅差22.2% — ChrisGPT · 2026-08-15