全 Gemini 编码船员实测:认知循环快 2.53 倍,零返修

leebase65 · reddit · 2026-08-20

作者把 Gemini 3.7 Flash 接入自建的「参谋长 + 工作船员」多 agent 体系,组建两支队伍对比:一支全 Gemini(planner/coder/tester/reviewer 不同强度),另一支由 GPT 5.6 Sol Max 和 Fable 5 Max 担任规划与审查、其余全 Gemini。

基准结果:认知循环快 2.53×、schema 成功率 100%、受控执行快 2.72×、零返修周期、高级订阅消耗降 70%。作者日常大量使用 Gemini 3.7,未观察到质量下降,但也承认基准任务可能不够难。

另一个亮点:他并未要求做竞品评估,是「战略顾问」ChatGPT 主动把此前的讨论目标写进了参谋长的 prompt——AI 自己补位做了没被交代的事。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →