GPT 5.6 Sol 登顶 ProgramBench,重构成本减半但偏科 Python

GPT 5.6 Sol (xhigh) 在 ProgramBench 基准测试中登顶榜首,成功从零重构了 200 个测试程序中的 2 个。该模型展现了生成全新代码而非死记硬背的能力,且在同等性能下成本较前代减半,但测试也暴露出其严重偏好 Python 编程语言的问题。

已确认

为什么重要

2026-08-11 ~ 2026-08-11 · 6 条相关

一手来源