让 Claude 与 Codex 同文档辩论拍板,实测有效但慢又贵
kshitizsriv · reddit · 2026-09-24
一位 Reddit 用户分享了自己的双模型辩论工作流:让 Claude 和 Codex 在同一个 markdown 文档里轮流追加「回合」、互相反驳直到收敛,本人充当人工传话人,用于定位策略、文章质量判断等真实决策。
有效之处
- 第二个模型确实能纠错:一个模型曾把某条路径断言为「近乎确定的收入」,另一个去查了服务商官网,证明没有任何一家保证工作量;还有一次一个模型基于对系统行为的假设论证,被另一个实际验证推翻。作者结论是「分歧+证据」胜过单模型。
痛点
- 文档涨到 2500+ 行,每轮都要全文重读,又慢又贵
- 双方有时同时发帖、各说各话跑偏
- 回合冗长,大量轮次在润色措辞而非检验推理
- 全靠人工传话
作者向社区求解:如何设置回合上限、发言顺序和停止规则,有没有共享决策文档模板而非不断增长的对话记录,是否该用便宜模型做批评轮、强模型只做终审,以及现成的编排工具。
「编程与Agent」频道最新
- PlayCanvas 引擎支持 Node.js 无头运行,不再依赖 JSDOM — willeastcott · 2026-09-24
- Burkov 发问:换用 Rust 或 C,会不会拖累 LLM 编程能力? — burkov · 2026-09-24
- 用 Jev 做奖励模型跑 RL,24 步把 AI 味奖励从 0.58 提到 0.76 — sophiamyang · 2026-09-24
- 有人用 Codex 10 分钟在旧游戏本上跑通 Qwen 加 Hermes Agent — markjeffrey · 2026-09-24
- Jev + Claude Code 组合走红:100 毫秒内替你拦截危险操作 — PrajwalTomar_ · 2026-09-24
- TensorSharp 结构化读取让本地决策 API 快 3.3 倍且零解析失败 — fuzhongkai · 2026-09-24