实锤数据:Jev 最自信的错误,96% 的 LLM 评委跟着错
deliprao · x · 2026-09-26
Delip Rao 公布关键实验数据:在 Jev 最自信的错误上,96.0% 的 LLM 评委判决重复了同样的错误答案——而如果错误相互独立,理论上应约为 50%。这是对「LLM 评委错误高度相关、集成无法去偏」这一论点的最直接量化证据,属于其关于 Jev 判定模型系列讨论的核心数据点。
所属事件:实验揭示 LLM 评委错误高度相关,级联收益有限(3 条相关)→
「研究」频道最新
- Redwood 实测:Astra 借 filler token 无人化推理,CoT 监测或失效 — scaling01 · 2026-09-26
- ACuRL:零人类数据让计算机使用智能体持续适应环境 — ysu_nlp · 2026-09-26
- 数学家 Tivadar Danka 总结 20 年生涯最重要的 10 条心得 — TivadarDanka · 2026-09-26
- GPT-6 Luna 比 5.6 更省推理 token,难题两者都栽 — mhmazur · 2026-09-26
- 去像素重建做世界模型:对比式世界模型只用潜空间训练 — bonniesjli · 2026-09-26
- 首次绘出雄性果蝇全脑连接组,16.6万神经元逐个标注 — burny_tech · 2026-09-26