8GB 显卡离线跑编程 agent:Ornith 1.5 35B 实测 30-40 tokens/秒
Sensitive_Song4219 · reddit · 2026-09-23
作者分享数周"完全本地 AI"开发实践:在 RTX 5060 Mobile(8GB VRAM)+ 32GB 内存上跑 Ornith 1.5 35b-a3b(MoE),达 30-40 tps 生成、300-400 tps 预填充。要点:
- 模型选择:Qwen 3.8 27b 仍是本地编程首选,但作者推荐 Ornith 1.5 35b-a3b 作为 30b-a3b 级替代——它通过额外训练获得类似"High reasoning"的更深入思考,而 Qwen 3.6 35b-a3b MoE 只有开/关两档思考、容易欠思考
- 工具链:Pi harness 下 Ornith 文件写入频繁失败,换 OpenCode(经 llama.cpp)后解决,代价是基础上下文约 11k tokens;OpenCode 还支持中途无缝切到云端模型处理复杂任务
- 实测:web-OS 测试基本可用但需两轮修 bug;本地排障路由器日志,10 分钟内定位 WLAN/WPS 问题,并自主构建了定时抓取合并路由器日志的监控脚本
结论:中端硬件上本地 agent 编程已相当可用。
「编程与Agent」频道最新
- 开发者晒 9 月提交量狂飙:Opus 5.5 与 GPT-6 Sol 让他“飞起来” — doodlestein · 2026-09-23
- 用 JEV 分类器分析 Wireshark 数据包,意外挖出家人 WiFi 后门 — multiply_matrix · 2026-09-23
- 299 条真实意图实测:分类器路由比 GLM-4-Flash 慢 6.5 倍但稳 — Sufficient_Flower860 · 2026-09-23
- 开源项目 OpenExecutive:8 个专家智能体组成你的虚拟高管团队,GitHub 5.1k 星 — tom_doerr · 2026-09-23
- Framer 推出 Skills:让 AI Agent 学会并复用你的设计系统与工作流 — soleio · 2026-09-23
- Cursor、OpenAI、Anthropic 同周推出协调者多智能体架构,但审查瓶颈未变 — omidfarhang · 2026-09-23