冷门基准揭示差距:给二进制文件复刻代码库,最强模型仅得 5.5%

Informal-Trouble2183 · reddit · 2026-09-06

Reddit 帖汇总了三个比主流编码基准更「深度」的软件工程能力评测,成绩差距远超常规榜单:

作者观点:理解编译后程序(读汇编级能力)才是衡量「深度智能」的真正标尺,各家旗舰模型在此能力上分化极为明显。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →