实测 Grok-4.7-high 一天:写分布式锁必死锁,工程能力不敌 GPT-5.6
karminski3 · x · 2026-09-23
博主实测 Grok-4.7-high 一天后的结论:整体打不过 GPT-5.6-sol-medium,「写了好多垃圾代码」。具体观察:
- one-shot 任务还行,但工程项目表现拉胯;
- 主要短板在视野窄、代码直觉与经验不足,容易漏掉边界条件;
- 给出了一个快速复现方法:让它写一个分布式锁,通常分分钟死锁,且怎么修都修不好。
「编程与Agent」频道最新
- Agent 让数据栈不再宽容:陈旧数据足以触发错误订单 — bigdata · 2026-09-23
- TypeSafe 推出 Jev:70-500ms 的「系统一」新原语,百万输入 token 仅 $0.042 — daniel_mac8 · 2026-09-23
- Stripe 推出 agentic 支付支持,非 Stripe 商户也可接入 — jeff_weinstein · 2026-09-23
- LLM 成本核算的隐形陷阱:token 口径不一致致用量低估 46 倍 — qaiser_mehdi · 2026-09-23
- 对话模式让 Agent 成功率从 100% 跌到 60%,UiPath 开源对话式评测框架 — EvalRaccoonDev · 2026-09-23
- 浏览器 Agent 零记忆重复烧 token,WebCMD 给 Chrome 加站点记忆 — PrajwalTomar_ · 2026-09-23