两个前沿模型互相审校实验设计,作者称效果如博士后对决
Tkaraletsos · x · 2026-09-13
作者分享了一个实践:用 Fable 5.1 与 Astra 对同一复杂任务的实验设计与分析进行交叉检查,发现两者在互相挑错中持续提升,效果像「两个争当最勤奋的聪明博士后」。
不过他也指出局限:
- 两个模型仍会犯不少错,需要多轮迭代才能剔除缺陷,而两者之间来回迭代确实很有效;
- 每隔几轮就需要人工把模型拉回核心任务,避免跑偏。
他最后提出疑问:这种双模型互查是否会成为新的 ensemble 预测范式。
「编程与Agent」频道最新
- 开发者实测 Devin SWE-2 加自定义 skills,零样本生成前端网站 — silasalberti · 2026-09-13
- 开发者开源 8 个带评测的免费 Agent Skills,含项目验尸与模拟读者工具 — Saboo_Shubham_ · 2026-09-13
- 三天实测 Claude Opus 当项目经理:多会话并行跑完网站重构 — tech_is______ · 2026-09-13
- AI 助手每小时 200 次订位被 Resy 封号,Agent 冲击消费平台 — thisiskp_ · 2026-09-13
- GGUF 复现难?开源 ModelBake 给每次构建生成可对比回执 — Acrobatic-Owl5700 · 2026-09-13
- 实测 OpenAI GPT-Live-1 语音代理:音质最自然但听不懂 yes — kolchinski · 2026-09-13