Cedana 联手 NVIDIA:单台 8×B200 节点托管整套编码模型组合
josh_wills · x · 2026-10-02
NVIDIA 与 Cedana 发布联合方案:在单个 8×B200 节点上托管一整套前沿编码模型组合。
- 架构分工:NVIDIA Dynamo 负责 serving,NeMo Switchyard 负责路由与升级(小模型失败时切换到大模型),Cedana 实现约 1 分钟内带会话状态的模型切换。
- 动机:企业自托管编码模型以保住代码与 token 成本控制权,但编码任务横跨补全、小修改、复杂调试与仓库级规划,单一模型无法全面最优。
- 关键数据:基于 TraceLab 约 4300 个 Claude Code/Codex 会话的公开 trace,中位请求 38 秒完成,但超过 10 分钟的 6% 请求消耗了 69% 的总请求时间——因此常驻中型模型处理大部分流量,前沿模型只服务长尾。
- 组合配置:长程规划用 DeepSeek-V4-Pro-NVFP4(约 873 GiB),困难任务用 Kimi-K2.6 / GLM-5.26,中等复杂度任务另配更小模型。
「编程与Agent」频道最新
- 语音 Agent 试点最该警惕什么?答案:虚假确认而非报错 — Legitimate-Pride-685 · 2026-10-02
- 用户实践:Gemini 新模型跑通宵开放式任务,日常交给 Flash — JMateosGarcia · 2026-10-02
- Claude Code 桌面版可把 diff 和终端窗格弹出至第二屏,主窗口继续跑任务 — EricBuess · 2026-10-02
- 用 Claude 搭 AI 版《叛徒》:30 天 Emergent 大戏同步上演 — bobo-the-merciful · 2026-10-02
- 两篇新论文用编码 Agent 做 3D 场景重建,Gemini 3.8 表现超预期 — kwangmoo_yi · 2026-10-02
- Anthropic Thariq 谈 Claude Mods、可变软件与多人协作 Agent 的未来 — daniel_mac8 · 2026-10-02