实验:LLM 的 JSON 合法≠决策一致,一致性最低仅 14.4%
tenkei_01 · reddit · 2026-09-27
作者在把 JEV 与 LLM 做速度-精度对比时发现被忽视的第三个维度:能否信任结构化答案作为决策对象。
- 合法 JSON ≠ 一致决策:作者要求搜索相关性任务同时输出连续分数和四级概率。分数 2.99 + 概率高度集中于 level 3 是一致的;但「分数 2.99 + 概率主要落在 level 1」这种自相矛盾的回复,JSON 完全合法、能过 schema 校验,却不是可信决策——生产系统该信哪个字段?
- schema 约束有代价:各供应商对 JSON/schema 约束输出支持程度不一,可能引入延迟、token 开销、重试和集成成本,且 schema 合法仍可能语义不一致。
- 一致性是决策质量的一部分:作者实测「最终分数是否匹配模型自身分布加权分数」,各配置的一致性在 14.4% 到 100% 之间。
结论:若需要结构背后的决策一致性,目前 JEV 是唯一能做到的输出方式;但他预计前沿实验室很快会跟进提供类似接口。
「编程与Agent」频道最新
- Science 模式:AI 自动剪辑科普讲解视频全流程 — realmeetjames · 2026-09-27
- MIT 教材论文写作章节走红:只有好论文才对职业有用 — Haoyu_Xiong_ · 2026-09-27
- 把 Claude Code PDF 技能发布成 shadcn 组件库 pdfcn,开源即引流 — rchardkovacs · 2026-09-27
- 开发者构想「自然语言自编码器」:和花园用聊天对话 — cephaloform · 2026-09-27
- 开源 Skill 把 Git 历史拍成短片,写给程序员的非技术玩法 — dotey · 2026-09-27
- 观点:Rust 式约束语言更适合 LLM,Agent 专用 DSL 将兴起 — burny_tech · 2026-09-27