Kimi K3 法律基准领先

petrusenko_max · x · 2026-07-19

Kimi K3 在一项困难的**自主法律工作 benchmark** 上拿到 **26.7%**,几乎是最近竞争者 Claude Fable 5 的两倍(**14.2%**)。 这个测试覆盖 24 个法律领域、共 120 个私有任务,包括 memo 和 deposition summary。模型需要完整处理案件文件并输出最终文档,而且评分很严格:任一 rubric 细节缺失就算失败。作者也指出,虽然 27% 已经领先,但 AI 要真正可靠地独立完成法律工作,还有很长路要走。

所属事件:Kimi K3 在 Harvey 法律基准领跑(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →