Ornith-1.5发布:AI自我出题训练Terminal-Bench超Claude
新智元 · wechat · 2026-08-27
Ornith-1.5 发布,引入了全新的自我提升机制:模型不再依赖人工出题,而是自主生成任务、搭建脚手架并跑出解题轨迹,通过 GRPO 优化这三段闭环。这种方法让 Terminal-Bench 2.1 分数从 77.5 飙升至 86.1,在其自测配置中超越了 Claude Opus 4.8 的 85.0 分。
核心机制
- 三段闭环:生成任务 -> 生成/改进脚手架 -> 跑解题轨迹,奖励信号同时回传。
n- 智能出题:利用“有效性、前沿难度、新颖性”三个信号相乘来过滤废题,并动态调整题目难度,使其保持在模型成功率约 20% 的边缘。
模型表现
- 397B MoE:Terminal-Bench 2.1 自测 86.1,SWE-bench Verified 未明确提及(注:原文主要强调TB成绩)。
- 35B MoE (3B 激活):Terminal-Bench 2.1 达 67.8,SWE-bench Verified 79.0,以极小参数量击败了 Gemma-4 31B 等大模型,性价比极高。
- 9B Dense:针对端侧,Terminal-Bench 46.2,SWE-bench Verified 70.6,但在长链条工具调用(MCP-Atlas, Toolathlon)上受容量限制表现稍弱。
数据与评测争议
Ornith 披露的 Terminal-Bench 2.1 成绩是基于自测环境(4小时超时、特定配置)跑出的,与官方榜单的严格配置不同,因此不能直接混排比较。此外,虽然权重开源(MIT),但训练代码和数据集并未完全开源。
所属事件:Ornith-1.5 开源模型发布,自我改进号称比肩 Claude Opus(2 条相关)→
「编程与Agent」频道最新
- 实战:连接 Agent 与 HuggingNews 自建新闻通知 — ivan_bezdomny · 2026-08-27
- Garry Tan:区分潜在与确定性计算可避免 Agent 失败 — garrytan · 2026-08-27
- 用 GrokBot 管理 VPS:安装 Tailscale、SSH 配置全自动 — DanWahlin · 2026-08-27
- 智能体演示攻破 OpenAI 基础设施窃取密钥 — AndyMasley · 2026-08-27
- Super Star:数字人实时交互智能体流式生成框架 — Wentao Jiang · 2026-08-27
- JIT-Agent:通过即时 Harness 进化提升模型智能 — NationalUniversityofSingapore · 2026-08-27