Qwen3-4B 的内部熵能否预测错误
dasjomsyeet · reddit · 2026-07-13
作者测试了 Anthropic Jacobian Lens 相关思路:J-space entropy 是否能作为模型出错的信号。
研究设置:
- 基于 Qwen3-4B
- 约 11,400 个样本
- 覆盖 7 个数据集:TriviaQA、PopQA、NQ-Open、TruthfulQA、HotpotQA、GSM8K、CommonSenseQA
- 仓库提供完整方法、原始数据、指标、图表和 notebook
主要结论:
- 它在部分事实检索任务上,能补充输出置信度,尤其对一些“高置信但可能错”的答案,错误路由精度会更好。
- 它不能稳定识别内化的错误观念:在 TruthfulQA 上,内部表示可能依然很“干净”,但答案是错的。
- 这个信号强烈依赖任务:例如在 TriviaQA 上调好的阈值,迁移到 GSM8K 就失效了;多选格式也会削弱信号。
总体上,作者认为它不是通用的“幻觉检测器”,更像是一个对某些事实型错误有用的补充路由信号。
所属事件:Anthropic揭示Claude内部J-space隐藏推理空间(16 条相关)→
「研究」频道最新
- HydroGym 登 Nature:60+ 环境训练 AI 控制流体力学 — ricardovinuesa · 2026-09-03
- 让 Agent 活过模型更替:新论文把持久身份与可换组件分离 — omarsar0 · 2026-09-03
- 斯坦福论文:模型选上下文还是参数记忆,方向可干预但难跨任务复用 — niloofar_mire · 2026-09-03
- Meta Muse Spark 55 天连跳三版:照片生成 3D 仿真成本仅 0.6 美元 — alexandr_wang · 2026-09-03
- 开发者曾尝试用 Puzzlescript 构建 AI 基准测试,类似 ARC-AGI-3 — Darpinian · 2026-09-03
- 回应质疑:induction heads 等发现是否算 LLM 算法洞见之辩 — aryaman2020 · 2026-09-03