100 项多智能体评测:Grok 4.7 解法有洞见但语法错误多,作者判为 flop

teortaxesTex · x · 2026-09-23

博主 leolinsky(经转发)称在 100 项多智能体编码评测中测试了 Grok 4.7:能跑通时,其方案常比同级前沿模型更有洞见,但浪费大量轮次甚至整次提交在语法与运行时错误上,响应速度也明显慢于 Grok 4.6,总体结论是 flop。该说法为第三方个人评测,未经证实,仅供参考。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →