研究者质疑安全报告引用 GPT-4 而非 5.6 作深度基准

jeremiecharris · x · 2026-09-03

在关于模型"深度"对比的讨论串中,作者指出应使用 GPT-5.6 Sol 作为能力参照而非 GPT-4,并推测报告方引用 GPT-4 是因为其相对当前规模被认为"浅",用"深度不到 GPT-4 两倍"的说法显得更令人放心。作者同时表示讨论串前文提到的其他问题依然存在。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →