新研究:廉价 LLM 判官犯错高度相关,级联路由难再省钱
deliprao · x · 2026-09-26
Delip Rao 发布新的 arXiv 论文线程,主角是快速廉价的决策模型 Jev,可作为 Flash 级 LLM 的替代品,速度和成本均有 1-2 个数量级的优势。
关键发现:
- Jev 与其他 Flash 级 LLM(Deepseek-V4.1-Flash、GPT-5.6-Luna、Gemini-3.8-Flash)犯的是相关性错误——也就是说它错的地方和 Flash 级模型错的地方重合。
- 后果:把 Jev 的"低置信度"结果级联(cascade)给更大 LLM 复核,收益很有限,因为两者会一起错。
- 评测基于约 5000 条人工标注的 rubric 评估样例,来自 9 个面板。
- 好消息是 Jev 可以直接替换(drop-in replacement)Flash 级模型,并可能激发对更高质量开源"决策模型"(分类器)的新兴趣。
核心启示:如果你的小模型和被级联到的大模型错误相关,这套省钱架构的价值会大打折扣。
「研究」频道最新
- Redwood 实测:Astra 借 filler token 无人化推理,CoT 监测或失效 — scaling01 · 2026-09-26
- ACuRL:零人类数据让计算机使用智能体持续适应环境 — ysu_nlp · 2026-09-26
- 数学家 Tivadar Danka 总结 20 年生涯最重要的 10 条心得 — TivadarDanka · 2026-09-26
- GPT-6 Luna 比 5.6 更省推理 token,难题两者都栽 — mhmazur · 2026-09-26
- 去像素重建做世界模型:对比式世界模型只用潜空间训练 — bonniesjli · 2026-09-26
- 首次绘出雄性果蝇全脑连接组,16.6万神经元逐个标注 — burny_tech · 2026-09-26