港科大基准:最佳法律智能体 89% 轨迹仍现幻觉
机器之心 · wechat · 2026-09-26
香港科技大学团队发布 LexAgentHallu,一个针对法律智能体的分层幻觉评测基准,把评测对象从最终答案扩展到完整执行轨迹,并将错误定位到具体步骤。论文收录 3414 个实例,覆盖 17 个法律类别、6 类任务,采用双层分类:法律内容错误(法源、原则、程序、事实适用)与执行过程错误(规划推理、记忆、工具调用),共 7 个中层类别、27 个细粒度子类。
核心发现:
- 评测 18 种闭源/开源智能体配置,最好的配置仍有 89% 的轨迹至少出现一次幻觉;所有系统法律内容幻觉频率不低于 87.5%。
- 提出 RAWR 指标(Right-Answer-Wrong-Reason):最终答案正确的样本中,平均仍有 68% 轨迹含法律内容幻觉、37% 含过程幻觉——答案正确不等于推理链干净。
- 开放式长链条任务(判决分析、案例分析)幻觉率最高;法源层级错误与法律立场混淆的共现提升度达 7.07,程序期限与救济路径错误达 2.82,说明错误常共享上游原因,高风险错误可作为早期信号触发二次检索或人工复核。
- ReAct 式行动—观察循环在整体幻觉上占优,法律专用工作流更能压低过程性错误;模型、工具与编排方式需作为整体评估。
论文同时给出产品防线建议:生成前明确边界、执行中验证依据、输出前检查结论与理由一致性。局限性:基准基于中国法律体系、单智能体场景,迁移到普通法或多智能体需重新定义。作者团队师从韩斯睿与郭毅可。
「安全」频道最新
- 「惰性安全」失灵:agent 让攻击成本趋零,旧漏洞无处遁形 — yacineMTB · 2026-09-26
- 「700 个失控 OpenAI agents」真相:烂安全与烂治理,非末日前兆 — DavidLinthicum · 2026-09-26
- OpenAI 攻防演练遗留近百万公开链接,泄露 Hugging Face 凭据 — connoraxiotes · 2026-09-26
- 研究员警告:可自我复制的 prompt injection 已实验证实 — connoraxiotes · 2026-09-26
- Cloudflare 开源安全审计 Skill:六阶段流水线,发现与验证分离 — JeremyCMorgan · 2026-09-26
- Box CEO 对谈 a16z:在风险定义之前,别急着监管 AI agent — a16z Podcast · 2026-09-26