1.3微秒CPU检测幻觉:120B大模型反而集体自信胡编

More_Slide5739 · reddit · 2026-10-02

本地跑 Ollama 的开发者常用 Oxford 语义熵方案检测幻觉,但需要跑 NLI 交叉编码器做两两比较,吃显存又加延迟。作者做了一个零依赖的 Python 指标 Spanda(Rsc):纯 CPU 上对 5 次采样(T=0.7)做字符串归一化 + 精确匹配香农熵,仅需 1.3 微秒、零 GPU 开销,并在 GSM8K/TriviaQA 上横测 1.5B 到 120B 模型:

实用结论:7B–27B 模型跑结构化任务(数学/代码/JSON/SQL/离散 QA)时,用 5 次采样 + 精确匹配熵即可获得约 0.89 AUROC,无需重型神经护栏。评测脚本、日志与完整报告均开源(GitHub: Spnda)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →