对标 GPT-4.5?开源模型 Ornith-1.5 自我改进刷榜
aftahi_ai · x · 2026-08-19
开源模型 Ornith-1.5 发布,包含 9B Dense、35B MoE 和 397B MoE 三个版本。该模型核心亮点在于采用了端到端的自我改进训练策略,不仅能解决任务,还能生成学习任务并构建脚手架。
评测成绩显示其在推理、Agent 和编码任务上表现强劲:
- SWE-Bench Verified 达 86(此前 SOTA 为约 50-60 区间)
- Terminal-Bench 2.1 得分 86.1
- Tool Decathlon 得分 71.2
作者声称其性能可媲美 Claude Opus 4.8。
所属事件:Ornith-1.5 开源发布,397B MoE 对标 Claude Opus 4.8(10 条相关)→
「模型」频道最新
- Unsloth 发布 Qwen3.8-27B 新量化版:精度提升 10% — danielhanchen · 2026-08-20
- Hugging Face 放出 SmolLM3 mid-training 检查点,回应 200 倍效率之争 — eliebakouch · 2026-08-20
- 5.6 Sol Ultra 搭配 computer use 被指像 Opus 4.5 搭配 MCP — curious_vii · 2026-08-20
- 实测 Gemini 3.7 Flash:极速 350 tok/s,代码能力存疑 — haider1 · 2026-08-20
- AntLing 开源 Ling-3.0 模型:WSM 合并替代 LR 衰减 — AcanthisittaOk1699 · 2026-08-19
- 10T 参数模型推理达 1000 TPS,AGI 实力差距引猜测 — legit_api · 2026-08-19