研究:注入置信度信号,Gemma 3 弃答率从 66.5% 降至 7%
dejanseo · x · 2026-09-08
Kumaran 等人发表于 Nature Machine Intelligence(预印本)的研究发现,语言模型是否回答问题由单一内部置信度信号决定,其影响比问题难度、事实可检索性和措辞强约十倍。
- 研究覆盖 GPT-4o、Gemma 3 27B、DeepSeek 671B 和 Qwen 80B;Llama 3.1 70B 因弃答率过低被剔除
- 基线阶段 GPT-4o 四选一强制作答正确率 63.7%,校准置信度与错误率相关系数达 -0.97
- 加入弃答选项后,GPT-4o 弃答 56.6%,作答部分正确率升至 69.1%;四模型弃答率 27%–82%,无差异点约 77%
- 激活引导实验:向 Gemma 3 27B 注入置信度向量后,弃答率可在 66.5% 与 7.0% 之间调节(基线 28.2%),中介分析显示该信号解释了 67.1% 的效应
- 意味着仅需操控一个内部数值,就能大幅改变模型的回答/回避行为
「模型」频道最新
- 博主直言:OpenAI 偷看 Codex 私有日志、暗中削弱模型毫不意外 — Linahuaa · 2026-09-08
- GLM 5.3 Flash 对比 DeepSeek V4.1:体素场景实测打平 — teortaxesTex · 2026-09-08
- 博主内部基准测试:中国模型质量调整后成本反高于美国模型 — kevinnbass · 2026-09-08
- 买 5849 欧 M5 Max 128GB 本地跑 Qwen,还是等 2028 年的 M7 Ultra? — Mxmtm · 2026-09-08
- DeepSeek Flash 4.1 曝已上线 API 测试,采用新架构提速 — kimmonismus · 2026-09-08
- Zvi 解读:OpenAI Astra 的思维链可监控性正在快速失效 — Don't Worry About the Vase (Zvi) · 2026-09-08