多模型互查仍会漂移:作者论证没有模型能监督好自己
alexcovo_eth · x · 2026-09-20
作者撰文指出,无论 GPT、Claude 还是 Gemini,任何模型都不足以监督自己,把多个模型塞进同一个 harness(如 Planner-Implementer-Reviewer 架构,甚至用不同模型分担角色)也解决不了问题。
他的观察是:团队让规划者说「大概需要一个恢复层」,实现者就把它造出来,审查者检查是否造对了——每一步都完成了,但没有人停下来问「我们到底为什么要建这个东西」。以「完成邮件集成」为目标,40 分钟后系统就自我说服成「构建一个弹性恢复与编排框架」。作者认为这是深度断裂,靠 skill 或 prompt 修补不了。
「编程与Agent」频道最新
- 用 Jev 结构化评估模型给 x402 Agent 做工具选择与计价决策 — kleffew94 · 2026-09-20
- 用 Astra 打造 iPhone 上的 Metal 版 Codex 模拟器 — Dimillian · 2026-09-20
- Vercel AI Gateway 推出 Evaluation API,返回结构化判定而非自由文本 — zeeg · 2026-09-20
- Codex /fork /side 缓存失效问题已修复,将随 0.156.0 上线 — YouJiacheng · 2026-09-20
- 施密特预言 UI 将消失:未来 90% 网络流量是 AI 代理 — rohanpaul_ai · 2026-09-20
- 用 GPT 6 Astra 做出可游览的桃花源记,配李立宏真人朗诵 — dotey · 2026-09-20