确定性验证66项全过,模型断言仅对一半:评测要分层

MuhammadMujtaba21 · reddit · 2026-08-24

作者对自己构建的验证能力基准做了复跑测试,核心发现是一个反差:确定性部分完美复现,模型相关指标却不及格。

由此作者提出核心区分:确定性验证能力 ≠ 模型生成正确性 ≠ 端到端生产可靠性。一个系统可以内部完全可复现,同时依赖一个产出不可靠断言的概率模型。

下一版基准将按流水线分层定位失败:模型输出 → 解析 → schema 校验 → 归一化 → 规范化 → 声明绑定 → 证据图 → 确定性验证 → 最终结果,而不是只给 PASS/FAIL。作者向社区提问:这类 LLM + 确定性系统的架构,是否应把各层拆成独立评测分数?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →