新基准测试:前沿大模型法律引用零样本仅42.6%全合规

hoofnagle · x · 2026-08-21

一项研究构建了包含 2,058 条 Bluebook(美国法律引用格式规范)查询的新基准,发现前沿大语言模型在零样本设定下平均只有 42.6% 的情况下能产出完全合规的法律引用。研究者称之为"令人失望但重要"的结果,凸显 LLM 在专业法律文书场景仍不可靠。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →