11 个前沿模型挑战链上任务,最强仅完成 53%

davidfromkansas · x · 2026-09-02

独立开发者 karinadoteth 把 Wintermute Alpha Challenge 2026 做成了一个 checker 验证的评测,对 11 个前沿及开源模型测试区块链编程与分析能力(8 个公开挑战、满分 750,代码题用 Foundry 测试在历史链分叉上验证,研究题用 SHA-256 哈希封存答案)。

核心发现:即便给足 2 小时时钟时间和 200 次工具调用,最好的模型(Opus 5)也只完成 53% 的挑战,Grok 和 Fable 同样止步 53%。模型能靠高推理(Claude 系)或快速迭代(开源系)写出协议代码,但在链上导航与复杂链上活动分析上集体失败——存在明显的能力断崖,作者认为只能靠更好的训练数据或微调解决。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →