100 项多智能体评测:Grok 4.7 解法有洞见但语法错误多,作者判为 flop
teortaxesTex · x · 2026-09-23
博主 leolinsky(经转发)称在 100 项多智能体编码评测中测试了 Grok 4.7:能跑通时,其方案常比同级前沿模型更有洞见,但浪费大量轮次甚至整次提交在语法与运行时错误上,响应速度也明显慢于 Grok 4.6,总体结论是 flop。该说法为第三方个人评测,未经证实,仅供参考。
「模型」频道最新
- Anthropic 上线 Opus 5.5 并告别 Opus 5,用户吐槽旧模型退役太无情 — repligate · 2026-09-23
- V4.1 预训练规模远超 V2.6 却差距存疑,DeepSeek 的 RL 是否真行遭质疑 — teortaxesTex · 2026-09-23
- OpenAI 发布 GPT-6 Sol 与 Luna,API 定价较 GPT-5.6 促销价低 50% — aziz4ai · 2026-09-23
- 基于 Llama 3.1 70B 打造无助手数据的角色模型 computer-10 — liminal_bardo · 2026-09-23
- ChatGPT 会话标题突然插入中文垃圾博彩词汇,原因不明 — Present-Resolution23 · 2026-09-23
- GPT-6 传闻代号 Sol,网友追问会不会登陆 ChatGPT — flowersslop · 2026-09-23