双 5070 Ti 跑 Ornith 1.5 35B-A3B:180 tok/s,速度为 Qwen 27B 的 3 倍
Excellent-Issue-5956 · reddit · 2026-10-05
作者在双 RTX 5070 Ti 16G(第二张走 OCuLink 扩展坞)+ 64GB RAM、Ollama/WSL 的本地 agent 配置中,把日常模型从 Qwen3.8 27B UD-Q4KXL 换成 Ornith 1.5 35B-A3B(Q4KM),结果:
- 自建 agent 测试:9 步长会话(工具调用、读文件、上下文压缩三次后的记忆)与 10 个编码小任务,两模型均 9/9 与 10/10;Laguna XS 2.1 也双通过,North Mini Code 1.0 仅 4/9
- 速度:128K 上下文时 Ornith 约 180 tok/s(占 24.4GB 全驻双卡),为 27B 的 55-70 tok/s 的约 3 倍。原因:每 token 仅激活约 3B 参数(256 选 8 专家),41 层中仅 10 层全注意力(2 KV 头),其余线性注意力,KV cache 几乎不涨——128K 升 256K 只多约 2GB
- 256K 可用但约 1.2GB 溢出到系统内存,速度降至约 139 tok/s,故默认 128K
- 厂商宣称 SWE-bench Verified 79、Terminal-Bench 2.1 68.5,作者未自行验证;Artificial Analysis 尚无评分
- 计划用 llama-server 试 YaRN factor 4 拉到约 1M 上下文
作者强调测试已饱和,只能证明不比 27B 差,不能证明更聪明。
「编程与Agent」频道最新
- Polyphonic 大更新:一个 Agent 指挥 Claude、Codex、Grok 分工干活 — RileyRalmuto · 2026-10-05
- ESR:AI 可反编译整个 3A 游戏,闭源软件保密时代将终结 — josephdviviano · 2026-10-05
- 研究员:Agent 时代跑评测必须带与不带 harness 各测一次 — prajdabre · 2026-10-05
- MIR Media Labs 发布本地 AI Studio Agent 演示 — Da_QbanBeast · 2026-10-05
- Plenio 把 YuE2 变成 DAW:ComfyUI 里的 AI 音乐工作站 — Vivid_Promise1700 · 2026-10-05
- 在单个 Durable Object 里跑通 pi-durable,自建本地版 Cloudflare — threepointone · 2026-10-05