SECRET 免训练法缓解音视频大模型跨模态幻觉,最高提升 18 个百分点
Yu Zhang · hf · 2026-10-02
论文针对音视频大语言模型(AVLLM)的「来源混淆 grounding 幻觉」:未被使用的模态线索会诱导模型给出所需模态不支持的回答。
关键发现
- 通过路径干预与表征分析,揭示「问题中继」机制:question states 中混入干扰模态的线索,削弱对正确模态证据的 grounding
- 切断干扰模态到 question states 的通路,比切断到生成位置的通路带来更高的正确答案 logit 恢复
方法:SECRET
- 免训练方法,利用不同模态通路干预引出的对比 question 表征,将原始 question states 引向所需模态的证据
- 在 CMM 与 AVHBench 两个基准、三个 AVLLM 上,一致优于以往免训练方法,较基座最高 +18.0 / +7.1 个百分点
- 模态特定字幕实验显示可泛化到开放式生成
「研究」频道最新
- 高德发布 ABot-Recon:仅靠 12 帧局部上下文实现流式长视频 3D 重建 — rsasaki0109 · 2026-10-02
- Neuralink 用 5 万小时神经数据预训练解码器,护城河或在数据集而非植入体 — CurieuxExplorer · 2026-10-02
- 安全评测 CyberGym 在验证子集上已被 Agent 刷饱和 — aryaman2020 · 2026-10-02
- SemEval-2027 新任务征集:四语言多模态新闻框架分析 — preslav_nakov · 2026-10-02
- 提示词与模型交替升级:科学 agent 准确率从 42% 提到 73% — rohanpaul_ai · 2026-10-02
- ISMIR 论文:交叉注意力让模型学会 12 位爵士钢琴大师风格 — umpedronosapato · 2026-10-02