熵轨迹形状可预测 Qwen3-4B 出错,并能迁移到未见任务
Happy_Brilliant7827 · reddit · 2026-09-06
核心发现
作者在本地运行 Qwen3-4B-Instruct-2507(Q5KL 量化)做校准实验:60 个编码任务、108 次生成(20 次失败),每次生成单 pass 捕获约 170 个熵/logit 统计量(熵轨迹、KL 散度序列、token surprisal 等),并用 Benjamini-Hochberg 校正多重检验。
- 唯一存活信号:一个轨迹形状统计量(d = −0.94,校正后 p = 0.008)——当模型熵早早进入平台期并保持平坦时,生成大概率是错的。
- 常用指标无效:大家常报的 maxentropy 只有 d = +0.17, p = 0.39。聚合熵指标会抹掉预测正确性的信息,印证了 Entropy-Lens 论文的预测。
- 跨任务迁移:300 次按任务分组的随机切换(整体留出任务),在未见任务上平均 balanced accuracy 0.73,92% 的抽样高于随机。说明信号学到的是「这个模型的错误长什么样」,而非记住具体任务——正是 DeepMind 语义熵论文提出的关键问题。
诚实的负面结果
- 同方法在 Granite-4.1-3b 上无可用信号,且任务级留出还抓到一个训练集上看似很强(0.87)、未见任务上低于随机(0.47)的假阳性——方法能自我纠错。
- 在另一组任务库上,同一模型的有效信号形状不同(早期不确定尖峰预测正确而非平台期预测错误):签名是 per-model 且 per-task-set 的,不存在普适熵规则,需定制调优但仍有价值。
作者公开了完整数据与报告(含两种留出层级、功效分析、干预排序)。
「模型」频道最新
- 用户反馈 Codex 应用端 Luna Max 消失,网页版仍可用 — Clear_Skye_ · 2026-09-06
- 同一个梦,两种文风:Fable 梦在散文,Astra 梦在数字 — teortaxesTex · 2026-09-06
- 自建空间推理基准被 Astra 全部打穿,作者直呼 VLM 视觉已解决 — pbaylies · 2026-09-06
- 传 Altman 回归数月即凭 Astra「碾压」Dario,e/acc 领袖开嘲 — beffjezos · 2026-09-06
- e/acc 领袖力捧 OpenAI Astra:用过直言「Claude 已审美疲劳」 — beffjezos · 2026-09-06
- 用户实测 Astra:模型很强但爱提前收工,需反复催促才继续干活 — ivan_bezdomny · 2026-09-06