三台本地机各构建 Miro 克隆五次,tokens/s 指标毫无意义
julianharris · x · 2026-10-04
作者用三台本地 AI rig(AMD 395、MacBook M5 Max、RTX 4090)同时构建自己的 "Miro MVP Clone",每台各跑 5 次以观察稳定性。
关键发现:
- 耗时方差 >10%,而质量方差相对一致(约 7%)。
- "tokens per second" 完全不是有用的指标:不同模型效率差异极大,且部分模型"思考方差"宽得离谱——同一个规格,一次 10 分钟完成,再来一次同样的任务却要 50 分钟(相差 5 倍)。
- 作者表示对此深感兴趣并有一些理论解释(未在帖中展开)。
这是一份少见的对 AI 编码 agent 输出稳定性/可重复性的一手实测,结论对依赖 agent 做实际工程的开发者有参考价值。
「编程与Agent」频道最新
- xAI 员工自曝用 50+ 个 Grok bot,靠管理 bot 编排调度 — petergyang · 2026-10-05
- arXiv 论文揭示:个人 Agent 记忆越多反而越容易出错 — rohanpaul_ai · 2026-10-05
- Raven V2 让 Rhino/Grasshopper 也能 agentic 建模,已覆盖 1.5 万席位 — burhop · 2026-10-05
- 独立开发者用 AI 全流程做游戏:半月连推三款,一款已上架 App Store — ezshine · 2026-10-05
- 多智能体群蜂几乎无用:切块让 1-2B 小模型召回率从 0.3 升至 0.57 — deadatreides1 · 2026-10-05
- 重写自家 Agent 后发现:大部分逻辑该是普通代码,LLM 只留一步判断 — Charming-Hawk-5760 · 2026-10-05