加 LLM 裁判自纠错反而掉点:抽取一致性从 85% 跌至 62%

RoadkiLLer_31 · reddit · 2026-08-22

在结构化数据抽取任务上,作者实测发现引入 LLM-as-a-judge 自纠错循环反而降低可靠性:独立抽取一致性约 85%,加上校验/重试循环后跌到 62% 以下。

作者向社区求问:生产系统如何避免 prompt 漂移与误差累积——字段级 diff/patch 或确定性规则门是否比让 LLM 整体重写更可靠?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →