Ericsson MARGIN:免训练运行时校准多智能体模型置信度
EricssonAB · hf · 2026-10-09
Ericsson 研究团队提出 MARGIN,一种多智能体协作下的运行时置信度校准方法:当协调者比较多个异构基础模型的答案时,各模型自报置信度的含义不一致,MARGIN 从观测到的答题结果中在线学习模型专属的置信度修正,无需重训模型或留出校准集。
方法:按置信度分带跟踪近期准确率与自报置信度的比值来修正报告值,稀疏分带向模型级估计混合,修正后的分数用于集体决策中的答案加权。
实验:覆盖代码生成、问答、数学,使用 18 个模型的池子及 9 模型子集做分布偏移实验。在 BigCodeBench 上,模型平均置信度与准确率呈负相关;在正确/错误答案对中,选更自信者胜率低于随机。相比五个在线校准基线,MARGIN 在多次分布偏移转换后的期望校准误差更低;在代码生成协调实验中,校准使答案选择准确率在三个基准中的两个上分别提升 4.3 和 14.0 个百分点。
「编程与Agent」频道最新
- 纯 shader 程序化生成城市 Gigacity:一个种子长出整座城 — Promptmethus · 2026-10-09
- 微软老将谈 vibe coding 边界:AI 能写代码,但架构判断仍离不开人 — mjuric · 2026-10-09
- shadcn谈AI时代最重要的编码技能:别让Agent替你读 — shadcn · 2026-10-09
- Philosopher Skill:一条 prompt 把任意领域变成可调深度的学习页面 — holyshitthatsucks · 2026-10-09
- Codex 被限速至 5 tok/s,博主称本地模型部署才是正解 — lxfater · 2026-10-09
- LangChain 创始人评 Jev 评测法:轨迹标注应拆成多个独立问题作答 — hwchase17 · 2026-10-09