港科大发布 LexAgentHallu:法律 Agent 幻觉要从全执行轨迹逐步定位
jiqizhixin · x · 2026-10-05
香港科技大学推出 LexAgentHallu,一个针对法律 LLM Agent 的幻觉评测基准。
核心问题:法律 Agent 可能引用错误法条,再在其上构建流畅论证——后续推理越连贯,初始错误越容易被看似正确的最终答案掩盖。幻觉一旦进入执行链,就不再只是错误文本,而成为下一步法律判断的前提。
评测思路转变:多数法律基准只给问题、检查最终答案;LexAgentHallu 把评测从最终答案转向完整轨迹,在具体步骤上定位错误。当 Agent 声称「已找到法律依据」或「该规则适用于当前事实」时,基准不仅查结论,还核查支撑理由是否真实、准确、且跨步骤一致。
「研究」频道最新
- ICML 2026 论文集上线 PMLR,共 306 卷收录首尔大会全部论文 — lawrennd · 2026-10-05
- 神经科学家 Anil Seth TED 演讲:AI 不会拥有意识,人们是在云中看出人脸 — anilkseth · 2026-10-05
- CMU 发布 cua-speedrun:首个统一测 computer-use agent 速度成本的基准 — rsalakhu · 2026-10-05
- TernaryQuench 开源 Qwen3 三值量化训练全流程,可直接 Ollama 跑 — casper_hansen_ · 2026-10-05
- Xaira 晒 AI 制药全景:「10 倍药物、10 倍患者、10 年」,GPCR 靶点已出早期成果 — BoWang87 · 2026-10-05
- 决策论讨论:智能体模拟弱预测器时是否该单盒 — jessi_cata · 2026-10-05