Kimi K3 在 Harvey 法律硬任务上比 Fable 5.1 高出 60%
togethercompute · x · 2026-09-10
Together Compute 发布称,Kimi K3 在 Harvey lab-aa 的高难度自主法律任务评测中得分比 Fable 5.1 高出 60%。这是针对真实法律工作流(自主完成任务而非单轮问答)的评测,若数据属实,显示 Kimi 新版本在专业垂直场景的自主任务能力有显著提升,值得后续关注官方完整榜单。
「模型」频道最新
- 年付 2 万欧客户控诉 Claude 变弱,疑 Anthropic 后台省算力 — maier_ak · 2026-09-10
- Meta 超级智能实验室总监回应质疑:Muse 好到黑不动 — alexandr_wang · 2026-09-10
- 用户称年付 2 万欧元用 Claude,却感觉模型越来越弱 — maier_ak · 2026-09-10
- AI 助手 Astra 说话常漏空格?用户:多发生在数字场景 — gandamu_ml · 2026-09-10
- 旅行途中用 Claude Code 遭遇:权限乱改、过早压缩会话 — maier_ak · 2026-09-10
- DeepSeek V4.1 Flash 流出可开启视觉输入,官方版仍未发布 — teortaxesTex · 2026-09-10