并行 ML 编排为何难做:语音系统 fan-out/fan-in 的生产级踩坑
Slight_Republic_4242 · reddit · 2026-09-10
Dograh 维护者在 Reddit 发长帖,讲并行 ML 编排在生产环境里的真实难度:
- 问题:fan-out/fan-in 看似简单,但 7 号模型慢、8 号失败、3 号跑到新输入时,你需要 barrier、按模型重试、输入快照、超时和真正的状态管理,而不是一堆 futures。
- 语音场景:一条工作流可能涉及 STT、LLM、TTS、工具、检索、分类器和电话服务,有的在关键路径上、有的不在,全部串成一条流水线是错的。
- 执行层要点:需显式区分 required vs optional、完成状态、重试策略、输入/版本管理。
- Dograh 架构实践:流式流量走负载均衡的 API workers,ARQ workers 与全局编排组件各自独立伸缩;长连 WebSocket、后台任务、全局通话状态与工作流执行 behave 很不一样。
- 主张:开源 agent runtime 应把「编排」当一等原语,而非实现细节。
「编程与Agent」频道最新
- Codex 原班人马长谈:为何用 Rust、为何开源、harness 如何运作 — mathemagie · 2026-09-10
- 用 Grok 修复 X 官方存档:补长推文展示、加排序功能,几小时搞定 — davidpattersonx · 2026-09-10
- banteg 发起众包:用 AI Agent 补齐游戏 Crimsonland 逆向工程难题 — banteg · 2026-09-10
- 从 Win3.1 消息循环到 Agent Loop:一文梳理 Agentic 执行机制的七次演化 — bibryam · 2026-09-10
- 截图可见≠模型收到:Agent 图像链路排查三步法 — derspenti · 2026-09-10
- 游戏开发者让 Claude 一次生成 RAG 教程,成品意外能用 — Ok_Number2804 · 2026-09-10