用户实测 Grok 订阅两周:编排理念好但模型不够聪明
letandrewcook · x · 2026-09-19
一位开发者在 FOMO 驱动下订阅了 Grok 的 bot 服务并使用两周后给出负面评价:模型本身不够聪明,无法信任它写代码甚至编排任何任务。他在 issue 管理、博客编辑、剧本写作、产品调研等多种任务上测试,每次都得把 Grok 的半成品输出再交给 Claude 或 ChatGPT 才能一次得到满意结果。不过他称赞其心智模型:「幕僚长(Chief of staff)+ 群组」是一个不错的编排模式,并表示会把这个思路搬到 Claude Code 里采用。
「模型」频道最新
- Burkov 提醒:闭源模型思考 token 不透明,计费可能被夸大 — burkov · 2026-09-19
- DiffusionGemma 原生视觉塔实现在手机上近实时目标检测 — bodonoghue85 · 2026-09-19
- 爆料称 DeepSeek v4.1 能自建训练任务并大规模验证 — teortaxesTex · 2026-09-19
- 实测质疑 Jev 准确性:60% 正面硬币被答成 99/1 — JnBrymn · 2026-09-19
- 实测模型概率判断翻车:60/40 的硬币被说成 99/1 — JnBrymn · 2026-09-19
- Pydantic 作者实测 Jev vs Sonnet:成本低 2.6 倍、快 3.7 倍 — samuelcolvin · 2026-09-19