COLM26研究:LLM验证科学声明靠捷径

UPenn NLP 的 Delip Rao 团队将在 COLM 26 报告一系列令人担忧的发现:现代 LLM 在科学/医学声明验证基准上得分很高,但大多并未真正逐条核对证据,而是走了捷径,导致高得分高估了其实际验证能力。

已确认

为什么重要

2026-10-06 ~ 2026-10-06 · 5 条相关

一手来源