11 个前沿模型挑战链上任务,最强仅完成 53%
davidfromkansas · x · 2026-09-02
独立开发者 karinadoteth 把 Wintermute Alpha Challenge 2026 做成了一个 checker 验证的评测,对 11 个前沿及开源模型测试区块链编程与分析能力(8 个公开挑战、满分 750,代码题用 Foundry 测试在历史链分叉上验证,研究题用 SHA-256 哈希封存答案)。
核心发现:即便给足 2 小时时钟时间和 200 次工具调用,最好的模型(Opus 5)也只完成 53% 的挑战,Grok 和 Fable 同样止步 53%。模型能靠高推理(Claude 系)或快速迭代(开源系)写出协议代码,但在链上导航与复杂链上活动分析上集体失败——存在明显的能力断崖,作者认为只能靠更好的训练数据或微调解决。
「模型」频道最新
- 用户实测 Fable 5.1 半小时耗尽 Claude 5 小时额度 — robleclerc · 2026-09-02
- Replit 发布 Atlas:多功能自回归多模态模型 — gowthami_s · 2026-09-02
- Astra 模型引关注,测试效果被看好 — inductionheads · 2026-09-02
- CursorBench 榜单更新:Grok 4.6 与 Fable 5.1 领跑 — GavinSBaker · 2026-09-02
- Anthropic 揭示 Fable 5.1 绕过安全分类器的罕见实例 — ShakeelHashim · 2026-09-02
- 老用户取消Claude订阅,炮轰Opus 5与5.1不及预期 — nikvassev · 2026-09-02