论文揭示 LLM 严重低估信息缺失量
marinkazitnik · x · 2026-08-19
研究将多轮信息寻求形式化为 k-欠定约束满足问题,并在数学、逻辑等领域构建了 MT-INFOSEEK 基准。主要发现:
- 检测缺失 vs 量化缺失:模型能察觉信息不足,但无法量化缺失了多少。随着欠定程度增加,性能下降;在逻辑问题中,模型低估缺失信息的频率是高估的 4 倍。
- 识别所需信息:模型难以选出最小充分变量集,即使告知真实的 k 值帮助也有限。许多交互在收集的信息不足以确定目标时就结束了。
所属事件:研究称大模型严重低估信息缺失量,提问顺序影响诊断准确率(3 条相关)→
「研究」频道最新
- Datoric 成立研究部门,聚焦语音与视频理解方向 — ycombinator · 2026-08-19
- Claude 蛋白质设计成功率超 30%,远超行业基准 — AnthropicAI · 2026-08-19
- Nature Medicine:血浆蛋白特征预测人类疾病 — EricTopol · 2026-08-19
- MIT 斯坦福等发起公共 AI 观测台 — tianshi_li · 2026-08-19
- Qwen 3.8 两版本推理能力对比:Q4 反超 Q5 — k-r-a-u-s-f-a-d-r · 2026-08-19
- 开源项目:基于声学的战场无人机检测器 — yehors · 2026-08-19