冷门基准揭示差距:给二进制文件复刻代码库,最强模型仅得 5.5%
Informal-Trouble2183 · reddit · 2026-09-06
Reddit 帖汇总了三个比主流编码基准更「深度」的软件工程能力评测,成绩差距远超常规榜单:
- Program-Bench:只给编译后的二进制和文档,要求 agent 不用反编译器、不上网,从零架构并实现复现原程序行为的完整代码库。GPT-6 Astra 仅 5.5%,Fable 5.1 为 7%,Kimi K3 2%,GLM 5.3 与 GPT 5.6 Sol 均 1.5%,Qwen3.8 27b 和 GPT 5.6 Luna 为 0%。
- SRE-Bench(vals.ai):考察无源码情况下理解真实二进制程序的能力。GPT-6 Astra 达 88%,GPT-5.6 Sol 55.9%,Claude Opus 5 (max) 仅 12.5%。
- Code Migration(vals.ai):把可运行的程序用另一种语言重写。GPT-6 Astra 67.7%,Fable 5.1 54.6%,GLM 5.3 44.2%,Qwen3.8 27b 14.2%。
作者观点:理解编译后程序(读汇编级能力)才是衡量「深度智能」的真正标尺,各家旗舰模型在此能力上分化极为明显。
「模型」频道最新
- 爆料称 20 万亿参数大模型即将到来 — Dr_Singularity · 2026-09-07
- 博主估算训练数据规模应为 5-7T,认为 8T 已属高估 — scaling01 · 2026-09-07
- 数学家指责 OpenAI Astra 十项数学成果涉研究不端:未引用已有文献 — asusarla · 2026-09-07
- Peter Gostev 辨析模型稀疏度爆料:Kimi 26:1、DeepSeek 32:1,1.2T 激活参数不可信 — inductionheads · 2026-09-07
- OpenAI 新模型在旧 Chat Completions 接口禁用 function tools,迁移二选一 — AI-Specialist-6597 · 2026-09-07
- 黄仁勋称“AGI 已到来”;中国大模型调用量连续 19 周全球第一 — 快鲤鱼 · 2026-09-07