ProgramBench 测试 AI 逆向能力,Gemini 3.6 Flash 表现最佳
OfirPress · x · 2026-08-08
ProgramBench 是一项专门测试 AI 智能体逆向工程能力的基准评测。它要求模型仅根据编译后的二进制文件和文档,在没有源码、反编译器或网络访问的情况下从零重建整个程序。
最新测试结果显示,谷歌的 Gemini 3.6 Flash 取得了该模型系列迄今为止的最佳成绩。评测作者透露,未来几天内还将加入更多模型的测试数据。
所属事件:Gemini 3.6 Flash 逆向重建程序能力登顶(3 条相关)→
「模型」频道最新
- 质疑AI推理能力:关闭推理模式后模型能力是否仍在提升? — inductionheads · 2026-08-08
- GPT-5.6 Sol 网络安全实战表现获好评,加速事件响应 — gdb · 2026-08-08
- OpenAI 与 ElevenLabs 宣布采用 Google SynthID 音频水印技术 — pushmeet · 2026-08-08
- Ollama 云端全面上线 DeepSeek-V4-Flash,输出速度超 120 tps — ollama · 2026-08-08
- DeepSeek V4 无视觉模块:模型自建亮度网格查错 — teortaxesTex · 2026-08-08
- MiniMax H3 微调遇阻:社区反映大数据集训练频繁崩溃 — Sorry_Warthog_4910 · 2026-08-08