1.5ms 检出幻觉:开源 Spanda 比 Semantic Entropy 快 9 万倍
Otherwise_Nobody_721 · reddit · 2026-09-05
- 开源项目 Spanda(MIT 协议,pip install spanda)是一个零依赖、纯 Python 的幻觉检测器,替代生产环境中常用的 Semantic Entropy(Farquhar et al., Nature 2024)。
- 原方案的痛点:Semantic Entropy 依赖 DeBERTa 聚类,单次查询约 136 秒还占 GPU 显存;Spanda 采样 K 个输出计算归一化词法一致率,约 1.5ms 跑在 CPU 上,零额外 API/显存成本,快约 9 万倍。
- 精度:在 7B–27B 模型的 GSM8K 数学推理任务上达到 0.889 AUROC,与重型 NLI 聚类持平。
- 重要发现「Confident Mode Collapse」:对重度对齐的前沿模型(120B+),即使 temperature=0.7,模型有时会在所有 seed 上复现同一个幻觉答案——幻觉达成 100% 一致时,一切自一致性方法都会失效,需要警惕。
- 作者征集生产管线中实时不确定性打分的实践经验。
「研究」频道最新
- Astra 从低算力到满配解决率几乎不变,RL 扩展故事遭数据打脸 — zainhas · 2026-09-05
- 开发者在 Minecraft 里跑通果蝇全连接组:166700 个神经元驱动苍蝇运动 — ZeroStateReflex · 2026-09-05
- Aroun 出题:把 RoPE 扩展到张量积架构 — thomasahle · 2026-09-05
- 模型会模糊记住「概念」而非原文:一场关于 SAE 特征与记忆的争论 — voooooogel · 2026-09-05
- ICML 立场论文:「无标签」不等于「无人类监督」,呼吁披露先验来源 — serrjoa · 2026-09-05
- 浙大与达摩院 VLA-Corrector:小模型审计划,机械臂成功率大涨 — 机器之心 · 2026-09-05