康奈尔研究显示,JSON 模式压缩 44 个模型答案多样性
omarsar0 · x · 2026-07-23
结构化输出不只是改格式,还会压缩答案多样性
康奈尔的一篇论文重新检验了一个常见假设:JSON mode 只是输出格式,不会影响内容。作者用 44 个语言模型 和 31 组开放式题目 做实验后发现,情况并非如此。
主要结果
- 在一个开放式“选一个词”任务里,仅仅要求模型输出 JSON,就把最常见答案占比从 41% 提到 64%,同时将不同答案数从 52 个降到 36 个。
- 这种“答案塌缩”出现在 JSON 和 XML 上;这两种格式本来就是模型后训练中常见的输出格式。
- 但在 YAML 和 CSV 上,这种现象不明显。
- 直接在解码器里强制 schema,并没有进一步压缩结果,说明变化主要发生在模型生成回答的阶段,而不是后处理阶段。
- 在一次重采样实验里,53% 的稳定聊天默认答案在 JSON 模式下发生变化,而且大多回到更常见的那一侧。
启示
如果你的 agent、抽取流水线或工具调用严重依赖 JSON mode,实际拿到的答案分布可能比你在聊天界面上看到的更单一。
「编程与Agent」频道最新
- T3 Chat推任务收件箱式侧边栏,终结对话碎片化 — threepointone · 2026-07-23
- 销售 deck 代理暴露推理后,团队才开始真正使用 — Professional_Cow2868 · 2026-07-23
- Claude Tag 为 Slack 工作区加入自动模式规则 — EricBuess · 2026-07-23
- MCP 工具调用底层机制深度解析 — jeffiql · 2026-07-23
- Steel 把 Hermes 浏览工具搬到云端跑网页 — Teknium · 2026-07-23
- OpenAI Codex 的加密上下文压缩可在 Pi 中启用 — dotey · 2026-07-23