前沿模型 council 研究:错也一起错
soumitrashukla9 · x · 2026-07-14
作者和合作者用同样的初始基准,重新跑了前沿模型实验,包括 GPT 5.5、Gemini 3.1 Pro、Claude Opus 4.8、Grok 4.5,并构建了“错误相关性”指标,衡量两个模型同时答错的概率。
他们发现:
- 没有任何 council 结构 能在任何 benchmark 上超过它最强的成员
- 模型之间几乎不怎么分歧;在全部 329 道题里,没有出现“只有一个模型答对”的情况
- 当它们答错时,往往是一起答错
作者认为,这支持了“consensus machines”的观点:模型因为共享训练数据、蒸馏目标和 RLHF 习惯,容易收敛到同样的错误结论。文中还提到,在 MMLU-Pro Math 上,6 组厂商配对都呈现出类似现象。
「研究」频道最新
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11