Kimi K3 法律基准领先
petrusenko_max · x · 2026-07-19
Kimi K3 在一项困难的**自主法律工作 benchmark** 上拿到 **26.7%**,几乎是最近竞争者 Claude Fable 5 的两倍(**14.2%**)。 这个测试覆盖 24 个法律领域、共 120 个私有任务,包括 memo 和 deposition summary。模型需要完整处理案件文件并输出最终文档,而且评分很严格:任一 rubric 细节缺失就算失败。作者也指出,虽然 27% 已经领先,但 AI 要真正可靠地独立完成法律工作,还有很长路要走。
所属事件:Kimi K3 在 Harvey 法律基准领跑(4 条相关)→
「模型」频道最新
- OpenRouter:前沿模型仍吃下大头收入 — thedealdirector · 2026-07-20
- GPT-6 或已训练完,但发布时间未明 — haider1 · 2026-07-20
- Kimi K3 可能逼 Anthropic 降墙 — StudentSweet3601 · 2026-07-20
- Codex 找到同一反例 — SebastienBubeck · 2026-07-20
- Kimi K3 被称为开源前沿新王 — PeterDiamandis · 2026-07-20
- DeepSeek v4 Flash 可能已在 API 上线 — datbackup · 2026-07-20