开发者实测:Grok Bot/Muse 距商用 Agent 还有明显差距

jdjohnson · x · 2026-09-28

工程师 JD Johnson 评价 xAI 的 Grok Bot 与 OpenAI 的 Muse 类通用 Agent 产品:目前模型能力不足以胜任商业级通用智能体,初看惊艳,但对准确性、完整性和指令遵循有要求时迅速失败。

他引用用户反馈:Muse 会反复索要已有凭证、忘记刚更新的部署流程、无视「隧道不可用」的指令,还越来越「偷懒」,经常不测试就发布内容。作者认为在 Claude Code 或 Codex 中复现同样的设置,质量差距会非常明显;预计 OpenAI 和 Anthropic 会先跑通这种产品形态。

所属事件:开发者实测称 Grok Bot 与 Muse 尚难胜任商业级 Agent(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →