单节点跑下整套编码模型组合:8x B200 上切换模型只需约 1 分钟
josh_wills · x · 2026-10-02
Cedana 与 NVIDIA Dynamo 团队合作,展示了在单台 8x B200 节点上托管一组前沿编码模型(大模型做长程规划、中型模型处理多数请求),模型间切换仅需约 1 分钟且不中断进行中的会话,破解了传统上 9-34 分钟冷启动导致的模型组合不可行问题。
核心要点:
- 企业越来越多采用模型组合策略:简单任务给小而便宜的模型,前沿模型只处理长尾难任务,但这本质是 GPU 利用率问题——多个模型装不进单节点,冷启动时间让切换不现实。
- 依据约 4300 个 Claude Code 和 Codex 会话的公开 trace(TraceLab):请求中位数 38 秒完成,但运行超过 10 分钟的 6% 请求占了全部请求时长的 69%,长尾特征明显。
- 方案分工:NVIDIA Dynamo 负责服务、NeMo Switchyard 负责路由与升级(小模型失败时切换到大模型)、Cedana 负责约 1 分钟的模型切换并保留会话。编码 agent 只需接入一个统一 API 端点。
- 文中列出了具体模型组合及显存占用,如 DeepSeek-V4-Pro-NVFP4 约占 873 GiB 用于长程规划层。
所属事件:Cedana 联手 NVIDIA:单节点托管整套编码模型(2 条相关)→
「编程与Agent」频道最新
- Snorkel AI 五篇论文入选 NeurIPS:最难长程任务 Agent 通过率不足 1% — ajratner · 2026-10-02
- cronstable:内置 MCP 服务器的开源任务调度器,让 Agent 直接排查定时任务 — ptweezy · 2026-10-02
- 四个 Agent 改同一个文件会怎样?作者实测 Git worktree 方案的边界 — pilver7 · 2026-10-02
- 让 Claude 跑 12 小时,产出动画短片《The Clodyssey》 — FinanceYF5 · 2026-10-02
- Hebbrix 推出托管 MCP 端点,专解 Agent 记忆「写入可搜」时差 — Separate_Sand8265 · 2026-10-02
- Greg Mushen 的智能体首次卡壳:触发安全机制需人工代发 — gregmushen · 2026-10-02