Ornith-1.5 发布:397B MoE 模型对标 Claude Opus
aftahi_ai · x · 2026-08-20
Ornith-1.5 是一系列开源 LLM(9B Dense, 35B MoE, 397B MoE),采用自改进策略训练。该模型声称在同等规模开源模型中达到 SOTA 性能,并在推理、Agent 和编码任务上表现出接近 Claude Opus 4.8 的能力。
关键成绩:
- Terminal-Bench 2.1: 86.1
- SWE-Bench (Verified): 86
- DeepSWE: 56
- HLE: 44.6
- ClawEval: 81.4
- Tool Decathlon: 71.2
该模型旨在通过端到端自改进循环来训练基础模型,扩展了自脚手架(self-scaffolding)策略。
所属事件:Ornith-1.5 开源模型家族发布,397B 对标 Claude Opus 4.8(15 条相关)→
「模型」频道最新
- Agent Arena 榜单:同档智能体任务成本相差超五倍 — arena · 2026-08-20
- Agent Arena 榜单:Kimi K3 性价比第一,Claude Opus 5 最贵 — arena · 2026-08-20
- 所谓的推理能力,只是后训练中的思考指令 — majidmanzarpour · 2026-08-20
- 识别 AI 写作:过度修饰的动词是破绽 — dbasch · 2026-08-20
- 为什么Qwen3.8 27B比DSv4 Flash贵?KV cache和量化是关键 — ihatebeinganonymous · 2026-08-20
- OpenAI 修复 Codex 误删用户文件的严重 Bug — The Decoder · 2026-08-20