新基准测试:前沿大模型法律引用零样本仅42.6%全合规
hoofnagle · x · 2026-08-21
一项研究构建了包含 2,058 条 Bluebook(美国法律引用格式规范)查询的新基准,发现前沿大语言模型在零样本设定下平均只有 42.6% 的情况下能产出完全合规的法律引用。研究者称之为"令人失望但重要"的结果,凸显 LLM 在专业法律文书场景仍不可靠。
「模型」频道最新
- Pangram v4 模型声称能移除 AI 水印并伪成人类写作 — Scobleizer · 2026-08-21
- Brundage 观察:ChatGPT 推理疑似异常,或为内部测试 — Miles_Brundage · 2026-08-21
- xAI 发布后再改 Grok 4.6 模型卡,有害网络合规率从 16.7% 下调至 6.9% — Miles_Brundage · 2026-08-21
- Claude 的「家话」更好用?网友呼吁实测证明 — voooooogel · 2026-08-21
- 2026年业余玩家还能玩什么后训练?有人押注扑克自博弈 — No-Compote-6794 · 2026-08-21
- Google 活动实测 Gemini 3.7 Flash,AI Studio 新功能亮相 — jocarrasqueira · 2026-08-21