AI 开口前就知道要胡说:HALP 用内部探针提前预测幻觉

thisdudelikesAI · x · 2026-08-28

Stony Brook 与丰田工业大学芝加哥分校的研究者提出 HALP(Hallucination Prediction via Pre-Generation Probing),在视觉语言模型解码开始前、单次前向传播阶段拦截模型内部状态,训练轻量探针来预测即将发生的幻觉。

传统做法只能等模型生成完整回答后再对照事实核查错误,为时已晚。HALP 直接从模型内部机制提取信号,包括视觉特征等三类线索,在第一个 token 生成之前就判断模型是否会胡说。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →