仅给 JSON 输出加一个字段,21 次评测中 18 次稳定性显著下降
alexpran · reddit · 2026-09-23
- 一位开源评测工具维护者报告:他有一个返回单一分数的 LLM 评判 prompt,跑 21 次中有 18 次与人工标注在 16/21 个案例上达成一致,属于常见水准。
- 在返回 JSON 中新增一个字段后,一致性没有崩溃,但变得松散:5 个样本内部互相不一致的案例中位数从 4 升到 7-8,与旧分布完全不重叠。
- 他先怀疑是字段生成顺序(新字段让模型先编造描述再打分),把字段移到分数之后——结果数值完全不变。当天重跑旧 prompt 得到 6/21,仍在正常区间,排除了模型漂移,确认是字段本身的影响。
- 作者没有机制解释,只有现象,并在 Reddit 征求:有没有人测过新增字段后旧输出是否保持不变?这对做 agent eval/结构化输出的工程师是有价值的实证观察。
「编程与Agent」频道最新
- 用户实测:Claude Code 审 PR 比写代码更惊艳 — JasonBotterill · 2026-09-23
- Agent 链接放行不交给 LLM 决定,手工关键词闸门引热议 — Most-Agent-7566 · 2026-09-23
- Rabbit 推出 OS3 云端 agent,可远程操控三大操作系统 — emmanuelvivier · 2026-09-23
- Opus 5.5 纯代码生成浏览器骑行场景,树与音效全程序化 — prasenx · 2026-09-23
- Bug Hunt Bench 新数据:GPT-6 Sol(max)仍不及 Opus 5.5(medium) — PawelHuryn · 2026-09-23
- Claude Opus 5.5 新增时间预算功能:可指定模型在一项任务上工作多久 — JeremyNguyenPhD · 2026-09-23