GPT-5.6 在 ZeroBench 达到人类基线
Waiting4AniHaremFDVR · reddit · 2026-08-11
据测试结果,GPT-5.6 Sol 模型在不使用外部工具的情况下,于 ZeroBench 基准测试的 pass@5 指标上达到了人类基线水平。
帖子同时澄清了相关评测术语的区别:pass@5 指在 5 次尝试中至少有 1 次正确即得分;pass^5 要求 5 次尝试全部正确;而所谓的 pass@1 实际上是 5 次尝试的平均得分,并非真正的单次测试准确率。
「模型」频道最新
- Claude 将黎曼猜想满足比例下界提升至 67.2% — BoyNextDoor1990 · 2026-08-11
- 曝 Google Gemini Omni Lite 即将发布,主打视频生成与编辑 — koltregaskes · 2026-08-11
- GPT 5.6 Sol 编程成本大降,同等性能花费减半 — jyangballin · 2026-08-11
- 研究称 GPT 5.6 Sol 能生成全新代码,非死记硬背 — jyangballin · 2026-08-11
- GPT 5.6 Sol 登顶 ProgramBench,成功重构复杂程序 — jyangballin · 2026-08-11
- Meta被曝将发布Apache协议前沿开源模型,开源生态迎重大利好 — TimDarcet · 2026-08-11