Modal 揭秘:如何为万亿参数编码 agent 服务万亿级 token
ivan_bezdomny · x · 2026-09-24
Modal 工程团队发布长文《How to serve trillions of tokens for trillion-parameter coding agents》,系统讲解其编码 agent 推理服务的技术实践。背景是团队发现自己在 OpenRouter 上承接了约 40% 的 Kimi K3 流量,因咨询太多干脆写成博客。文章核心论点:编码 agent 的推理服务必须在「相对性能」(逼近硬件峰值算力的利用率,如 petaFLOP 级 Tensor Core)与「绝对性能」(万亿参数模型、单请求即巨量计算)两个维度同时做到极致;只有规模大到能摊薄硬件与工程成本,这类服务在经济上才可行。全文约 20 分钟阅读,覆盖生产级 LLM 推理栈的设计取舍,属于 infra/agent 服务方向的深度工程复盘。
「编程与Agent」频道最新
- Google 论文:自动优化 agent harness 会让分数涨、真实任务变差 — omarsar0 · 2026-09-24
- 博主开讲 Agent Evals 视频系列,第一集:如何阅读 traces — doesdatmaksense · 2026-09-24
- 用 Opus 形式化验证 Claude Agent SDK,几条 prompt 修出 16 个 PR — dyn___ · 2026-09-24
- 开源工具 Jev+Treg 做线索挖掘:每条有效线索低至 $0.029 — cneuralnetwork · 2026-09-24
- uv 作者解释:仅凭 lockfile 就重建了元数据校验行为 — charliermarsh · 2026-09-24
- 让 Claude 与 Codex 同文档辩论拍板,实测有效但慢又贵 — kshitizsriv · 2026-09-24