Ornith-1.5发布:AI自我出题训练Terminal-Bench超Claude

新智元 · wechat · 2026-08-27

Ornith-1.5 发布,引入了全新的自我提升机制:模型不再依赖人工出题,而是自主生成任务、搭建脚手架并跑出解题轨迹,通过 GRPO 优化这三段闭环。这种方法让 Terminal-Bench 2.1 分数从 77.5 飙升至 86.1,在其自测配置中超越了 Claude Opus 4.8 的 85.0 分。

核心机制

n- 智能出题:利用“有效性、前沿难度、新颖性”三个信号相乘来过滤废题,并动态调整题目难度,使其保持在模型成功率约 20% 的边缘。

模型表现

数据与评测争议

Ornith 披露的 Terminal-Bench 2.1 成绩是基于自测环境(4小时超时、特定配置)跑出的,与官方榜单的严格配置不同,因此不能直接混排比较。此外,虽然权重开源(MIT),但训练代码和数据集并未完全开源。

所属事件:Ornith-1.5 开源模型发布,自我改进号称比肩 Claude Opus(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →