LLM 常高估自己:答对了不代表收集够了信息
rohanpaul_ai · x · 2026-09-13
Rohan Paul 总结新论文《Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking》(arXiv:2608.14808):LLM 经常低估自己需要收集多少信息就提前停止提问,因此应在其停止提问的时刻做评估,而不能只看最终答案准确率。一个正确答案可能掩盖糟糕的信息收集——模型可能靠先验知识或猜对,而并未收集足够证据。
「研究」频道最新
- 斯坦福MIT论文:同一模型换个harness性能差6倍 — rohanpaul_ai · 2026-09-13
- 斯坦福 CS 312「深度学习炼金术」开课,全部录像与材料将公开 — anshulkundaje · 2026-09-13
- SGLang团队开源Miles v0.1:64卡训744B模型,每步263秒 — aigclink · 2026-09-13
- 把半条命2僵尸mod反编译后做并行深度强化学习训练 — shakoistsLog · 2026-09-13
- 开发者玩转字符级模型:免 retokenization bug、随意字符串处理 — cephaloform · 2026-09-13
- SEED-UMI:人机共享外骨骼实现灵巧操作一对一样本采集 — jeasinema · 2026-09-13