加 LLM 裁判自纠错反而掉点:抽取一致性从 85% 跌至 62%
RoadkiLLer_31 · reddit · 2026-08-22
在结构化数据抽取任务上,作者实测发现引入 LLM-as-a-judge 自纠错循环反而降低可靠性:独立抽取一致性约 85%,加上校验/重试循环后跌到 62% 以下。
- 设置:GPT-5.4 分别作为抽取器和裁判;默认超参下一致性不足 35%,显式锁定 temperature=0、reasoningeffort="none" 后稳定到 85%。
- 退化原因:一是裁判评估的微小方差触发严格二元校验门,导致不必要的重跑(噪声复利);二是把错误列表回喂给抽取模型重新生成整个 JSON,会改变 token 分布,把原本正确的字段也改错(重生成漂移)。
作者向社区求问:生产系统如何避免 prompt 漂移与误差累积——字段级 diff/patch 或确定性规则门是否比让 LLM 整体重写更可靠?
「编程与Agent」频道最新
- 如何手写 AI Agent 的浏览器 Harness/MCP 并对比 Playwright — Jin-109 · 2026-08-22
- 集成 Sharp 模板至 NInfer,输出 Token 降 42% — xrailgun · 2026-08-22
- 开发者重实现 Pyramids 模型,基于 ViT-B/32 架构 — cephaloform · 2026-08-22
- 开发 CI 故障诊断智能体,寻求隐状态验证建议 — No-Cheetah-4745 · 2026-08-22
- Semantic API MCP:支持自然语言搜索 700+ API 接口 — modelcontextprotocol · 2026-08-22
- 发布 Remote MCP 服务器:集成 Base64、DNS 查询等 10 种开发工具 — modelcontextprotocol · 2026-08-22