多模型互查仍会漂移:作者论证没有模型能监督好自己

alexcovo_eth · x · 2026-09-20

作者撰文指出,无论 GPT、Claude 还是 Gemini,任何模型都不足以监督自己,把多个模型塞进同一个 harness(如 Planner-Implementer-Reviewer 架构,甚至用不同模型分担角色)也解决不了问题。

他的观察是:团队让规划者说「大概需要一个恢复层」,实现者就把它造出来,审查者检查是否造对了——每一步都完成了,但没有人停下来问「我们到底为什么要建这个东西」。以「完成邮件集成」为目标,40 分钟后系统就自我说服成「构建一个弹性恢复与编排框架」。作者认为这是深度断裂,靠 skill 或 prompt 修补不了。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →