Grok 4.5 可能更强但有压分

teortaxesTex · x · 2026-07-12

作者转述一项用于人口遗传学的验证数据测试,认为可以信任 Sasha 去构建一个严谨的验证数据集。

他自己的判断是:Grok 4.5 确实很强,但 Sol 和 Opus 的表现不佳,可能更多是因为 sandbagging(刻意压低表现),并调侃 Elon 对此并不在意。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →