Epoch AI 的 MirrorCode 基准首次见 Claude Fable 解出两项任务
Jsevillamol · x · 2026-08-04
Epoch AI 的 MirrorCode 基准用来测试 AI agent 能否从零重实现现有软件项目,而且必须通过 100% 的可见和隐藏测试 才算成功。
帖子里提到,在团队评测过的模型中,Claude Fable 是第一个至少在一次运行中同时解出 C 预处理器 和 Pkl 任务的模型。它既是一个新的评测基准,也给出了一条具体的模型能力信号。
「模型」频道最新
- 用户称 DeepSeek 只花 7 美分,还做得比 GPT-5.6 Sol 更好 — yacineMTB · 2026-08-04
- 发帖者称 DeepSeek 这次输出胜过 GPT-5.6 Sol — yacineMTB · 2026-08-04
- Kimi 和 GLM 5.2 定价继续下探,模型跨平台迁移加速 — markjeffrey · 2026-08-04
- OpenAI 揭秘:6 个月打造 GPT 实时低延迟语音系统 — borowcy · 2026-08-04
- 基准测试称前沿模型仍难正确实现基础 PDE 求解器 — GaryMarcus · 2026-08-04
- DeepSeek V4 Flash 编码榜单反超 Qwen 3.8 Max 和 GLM 5.2 — airesearch12 · 2026-08-04