GPT-5.6 与 Grok-4.5 的 SimpleBench 表现引争议

GPT-5.6 系列与 Grok-4.5 在 SimpleBench 基准测试上的表现引发了社区争议。尽管有人认为这几款模型取得了极强的成绩,但也有测试指出 GPT-5.6 Sol/Pro 的表现实际上落后于前代 GPT-5.5,这种起伏不定的表现被外界称为“参差不齐的智能”。

2026-07-10 ~ 2026-07-11 · 2 条相关

事件全程(共 20 集)→