GPT-5.6 在 ZeroBench 达到人类基线

Waiting4AniHaremFDVR · reddit · 2026-08-11

据测试结果,GPT-5.6 Sol 模型在不使用外部工具的情况下,于 ZeroBench 基准测试的 pass@5 指标上达到了人类基线水平。

帖子同时澄清了相关评测术语的区别:pass@5 指在 5 次尝试中至少有 1 次正确即得分;pass^5 要求 5 次尝试全部正确;而所谓的 pass@1 实际上是 5 次尝试的平均得分,并非真正的单次测试准确率。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →