开源 Ornith-1.5 发布:397B MoE 四项基准胜过 Claude Opus 4.8
rohanpaul_ai · x · 2026-08-20
Ornith-1.5 是一个开源 LLM 家族,包含 9B Dense、35B MoE 与 397B MoE 三个规格,采用「自我改进」策略训练。397B 版本在四项基准上超过 Claude Opus 4.8:
- Terminal-Bench 2.1:86.1 vs 85
- SWE-bench Verified:86 vs 85.8(另 Pro 65.1、Multilingual 79.6)
- WideSearch:80.8 vs 72.9
- BrowseComp:86.6 vs 84.3
- 其他:DeepSWE 56、HLE 44.6、ClawEval 81.4、Tool Decathlon 71.2
架构上的关键跃迁是把任务生成、agent 设计与解法生成放进同一个 RL 循环:模型自己提出任务、编写评分 scaffold、生成 rollout,并用 GRPO 把奖励回传到全部三个阶段。这种自生成课程在模型当前能力边界附近搜索任务,大幅减少人工任务设计,是迈向端到端自我改进训练的重要一步。
所属事件:Ornith-1.5 开源模型家族发布,397B 版对标 Claude Opus 4.8(20 条相关)→
「模型」频道最新
- Qwen3.8 27B 性能提升 3 倍,展示开源模型迭代优势 — TheMoonMidas · 2026-08-20
- Mac 本地运行 27B 多模态模型,三年前不可想象 — TheMoonMidas · 2026-08-20
- Qwen 3.8 27B 性能超越 Opus 4.8,闭源护城河何在? — haider1 · 2026-08-20
- 分析指 OpenAI 与 Claude 为止损降级推理,付费用户亦受影响 — 2C_ornot2C · 2026-08-20
- 用户对比 Grok 4.6 与 Sol:模型切换影响 Agent 体验 — WolframRvnwlf · 2026-08-20
- 开源 Ornith-1.5-35B-GGUF 版本登顶 Hugging Face — ornith-ai · 2026-08-20