Kimi K3 在自主法律工作基准测试中领先
rohanpaul_ai · x · 2026-07-19
在一项针对自主法律工作的严格基准测试中,Kimi K3 以 26.7% 的成功率大幅领先第二名 Claude Fable 5(14.2%)。
该测试包含 24 个法律领域的 120 项真实任务(如撰写备忘录和取证摘要),要求模型自主阅读案卷并生成完整的法律文件。评分极为严格,遗漏任何细节即判定整个任务失败,这解释了为何领先者的成功率也仅为 26.7%。
整体来看,每 100 个任务中仅能成功完成约 27 个,说明 AI 在完全无监督的法律工作领域仍有很长的路要走。
所属事件:Kimi K3 在 Harvey 法律基准领跑(4 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03