康奈尔研究显示,JSON 模式压缩 44 个模型答案多样性
omarsar0 · x · 2026-07-23
结构化输出不只是改格式,还会压缩答案多样性
康奈尔的一篇论文重新检验了一个常见假设:JSON mode 只是输出格式,不会影响内容。作者用 44 个语言模型 和 31 组开放式题目 做实验后发现,情况并非如此。
主要结果
- 在一个开放式“选一个词”任务里,仅仅要求模型输出 JSON,就把最常见答案占比从 41% 提到 64%,同时将不同答案数从 52 个降到 36 个。
- 这种“答案塌缩”出现在 JSON 和 XML 上;这两种格式本来就是模型后训练中常见的输出格式。
- 但在 YAML 和 CSV 上,这种现象不明显。
- 直接在解码器里强制 schema,并没有进一步压缩结果,说明变化主要发生在模型生成回答的阶段,而不是后处理阶段。
- 在一次重采样实验里,53% 的稳定聊天默认答案在 JSON 模式下发生变化,而且大多回到更常见的那一侧。
启示
如果你的 agent、抽取流水线或工具调用严重依赖 JSON mode,实际拿到的答案分布可能比你在聊天界面上看到的更单一。
「编程与Agent」频道最新
- 现代 AI Agent 协议栈的 11 项实用地图 — TheTuringPost · 2026-07-27
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 东京 Agent Forge 黑客松一天做出可上线 AI agents — DavidBennett__ · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一个 VS Code 扩展给 Alchemy 模板加上 Markdown 高亮 — samgoodwin89 · 2026-07-27