Harvey以Kimi K3为底座自训法律模型,应用层自研模型成新趋势
机器之心 · wechat · 2026-09-14
机器之心梳理了应用层 AI 企业“自训练专属模型”的新趋势,并介绍情感机器推出的训练平台 PyTRIO。
行业趋势与案例
- 法律 AI 公司 Harvey 发布首个开放权重后训练模型 Tenet,以 Kimi K3 为底座,在法律智能体基准 LAB 上全通过率 19.7%,高于 Fable5(11.5%)和 GPT-5.6 Sol(2.5%),单任务成本 5.92 美元也更低。
- Cursor 的 Composer 2 以 Kimi K2.5 为底座,结合持续预训练与大规模强化学习及产品反馈,多项编程基准进入第一梯队,推理成本约为同类前沿编程模型的 1/6–1/10。
- 桥水基金与 Thinking Machines Lab 以 Qwen3-235B 为基础、金融专家参与标注,六类金融信息筛选任务准确率 84.7%,超过最佳前沿模型(78.2%),单任务推理成本降低 13.8 倍。
- Mercor CEO Brendan Foody 认为,企业将先针对会计、销售、设计等领域后训练开放模型,再为大客户定制,以摆脱对闭源 API 服务条款、价格与供给的依赖,把数据与业务判断沉淀为资产。
PyTRIO 平台
- 情感机器推出 Training API 模式(TaaS):用户在本地编写数据、Loss、Reward 和训练逻辑,GPU 计算通过 API 上云,分布式训练与环境配置由平台处理,已适配昇腾 950PR、910B 等国产芯片。
- 示例实验:Search-R1 多轮搜索 RL 用约 13.3 元成本将 MacroEM 从 28.57% 提升至 45.71%;医疗蒸馏 SAR-OPD 在 MedQA-zh 达 84.33% 同时恢复通用能力;VisionGRPO 使 GeoQA 准确率从 71% 升至 87%。按 Token 或 GPU 时两种计费模式适配不同负载。
「公司和人」频道最新
- OpenAI 千禧年大奖解法被疑偷用用户数据,数学家公开表示不信 — francoisfleuret · 2026-09-14
- OpenAI、Anthropic 与 Google 拟共建行业主导的模型安全标准组织 — Scobleizer · 2026-09-14
- 前 Anthropic 员工 Jacob Coxon 辞职,称造 AI 如「召唤外星物种」 — AlexTensor · 2026-09-14
- tszzl:近十年找不到不曾在实验室轨道上的顶尖 AI 人才 — nitarshan · 2026-09-14
- 新加坡 OpenAI 黑客松:5 小时造出医学生急诊语音模拟训练器 — gabrielchua · 2026-09-14
- OpenAI、谷歌、xAI 齐声附和 Anthropic 呼吁,表态给 AI 提速踩刹车 — nordicinst · 2026-09-14