港科大基准:最佳法律智能体 89% 轨迹仍现幻觉

机器之心 · wechat · 2026-09-26

香港科技大学团队发布 LexAgentHallu,一个针对法律智能体的分层幻觉评测基准,把评测对象从最终答案扩展到完整执行轨迹,并将错误定位到具体步骤。论文收录 3414 个实例,覆盖 17 个法律类别、6 类任务,采用双层分类:法律内容错误(法源、原则、程序、事实适用)与执行过程错误(规划推理、记忆、工具调用),共 7 个中层类别、27 个细粒度子类。

核心发现:

论文同时给出产品防线建议:生成前明确边界、执行中验证依据、输出前检查结论与理由一致性。局限性:基准基于中国法律体系、单智能体场景,迁移到普通法或多智能体需重新定义。作者团队师从韩斯睿与郭毅可。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →