多问题单请求并行评估无一致性校验:用禅宗公案讲透 LLM 结构化输出的盲区
Successful-Farm5339 · reddit · 2026-09-20
作者借赵州「狗子佛性」公案指出结构化 LLM 输出的一个真实缺陷:一次请求中的多个问题被独立并行评估,问题 A 的答案不会成为问题 B 的上下文,因此框架内没有任何机制检查答案之间是否自洽。
- 典型场景:发票流水线一次请求里同时要文档类型、是否引用采购单、审批层级、紧急度评分,模型可以同时返回「贷项通知单」和「自动审批」——两个答案各自合法、都不是幻觉,但组合上不可能同时为真
- 置信度阈值解决不了:这不是「模型不确定」,而是「问题问错了」,两个答案都可以高置信
- 「无」(拒绝问题本身)必须放在模型之外:作者的做法是把策略写成对答案集的约束,调用后跑 SHACL 校验器,约束失败时弃权或升级而不是按概率分支
- 诚实提醒:校验器本身也要被校验——其 SHACL 引擎通过 120 项 W3C Core 测试中的 91 项,OWL-RL 78 条规则中 29 条经 Lean 机器证明认证,覆盖是部分的
- 他查遍 awesome-jev 上的 6 个 guardrail 项目,都是把模型指向输入侧(工具调用、prompt injection),没有项目检查响应内部答案间的一致性
结尾向社区提问:一次发 8-10 个问题时,你的技术栈里谁能说「以上都不对」?
「编程与Agent」频道最新
- 让编码 Agent 自测后端 API:开源 CLI 打包失败现场供其自我修复 — KARYTON618 · 2026-09-20
- OpenEnv 开源项目活跃:社区贡献基建适配、MCP 与 WebSocket 修复 — ben_burtenshaw · 2026-09-20
- Gemma 26B A4B 本地实测:一次过 C++ 编码测试,工具调用却频翻车 — HyperWinX · 2026-09-20
- 小出版社用 Claude 替代外包开发,省下每月上万美元开发费 — ORATX · 2026-09-20
- mitsuhiko 谈智能体编程的共同挫败感:它比看起来更难 — mitsuhiko · 2026-09-20
- 阿拉伯语圈最全 Codex 桌面版教程:从安装到 MCP 实战 55 分钟讲透 — aziz4ai · 2026-09-20