实测重试策略:补错误反馈让本地模型解题率从 42% 升到 75%
BlubberingSense · reddit · 2026-09-02
作者用 Advent of Code 2024/2025 的题目作为有客观正确答案的测试集,固定使用 qwen3.8:27b 本地模型,逐项变量测重试策略的回报。
核心数据
- 1 次尝试+允许自我修复错误:42% 解决率
- 3 次尝试但无反馈:58%
- 3 次尝试+每次允许根据错误自我修复:75%
关键结论
- 大部分直觉做法无效:调高 temperature、改写错误措辞都没用。只有给模型「它不知道的新信息」的干预才有效——全新独立尝试(可能换路线)和真实 traceback(代码实际运行产生的事实)。
- 有一个问题在所有配置下 13 次全失败,模型每次犯同样的错误假设:失败是系统性而非随机时,重试只是重掷同一颗骰子。
- 与 HumanEval/SWE-bench 等基准相反,这项实验固定模型、只变策略。
给构建重试循环的人的规则:加干预前先问「模型因此学到了什么它原本不知道的东西」,答案是「没有」就别加。样本量小(4 题×3 次),但在未测过的 AoC 2025 上复验了模式。
「编程与Agent」频道最新
- Omnigent v0.12.0 发布:可导入 Claude Code、Codex 等 CLI 会话 — matei_zaharia · 2026-09-03
- AsyncGRPOTrainer 新增 LoRA 训练支持,FSDP2 实测跑通 — QGallouedec · 2026-09-03
- ZenML 推出 Kitaru:像刷 Tinder 一样评估 agent trace — strickvl · 2026-09-03
- SkyPilot 推出 Agent Sessions:断线后编码 Agent 继续跑在自家 K8s 上 — skypilot_org · 2026-09-03
- 投机式工具调用怎么保证安全:只在可解析的安全路径提前开跑 — CShorten30 · 2026-09-03
- Agent 评测到底测什么?实用指南:从真实失败案例出发写 evals — ialijr · 2026-09-03