Grammarly 拆解支撑每周 1000 亿次 LLM 请求的推理架构
jefrankle · x · 2026-09-21
Superhuman(Grammarly 旗下)工程师发文详解其 GEC 语法纠错模型的服务架构:4 千万日活用户、每周约 1000 亿次 LLM 请求,如何保持实时延迟并控制成本。
关键要点:
- GEC 是「环境式」AI 功能:不像用户主动触发的请求,红线建议必须瞬时出现,延迟不可妥协。
- 采用内部自建推理 + 外部供应商混合架构,以应对流量峰值和 GPU 短缺等容量约束。
- 系统从小型专用模型流水线(数亿参数级别)演化而来,灵活可扩展但维护成本高。
- 文章面向生产级 LLM 基础设施团队,分享了容量弹性、性能与成本权衡的实践经验。
「Infra」频道最新
- 黄仁勋重申 AI 基础设施市场将达 3-4 万亿美元;Meta 遭生物识别诉讼 — emmanuelvivier · 2026-09-21
- 线上分享:用 d-Matrix 芯片做分解式投机解码与推理引擎调优 — cfregly · 2026-09-21
- 260 万美元 RL 就近 SOTA:数据成本会否超过训练成本? — my_cat_can_code · 2026-09-21
- Program-as-Weights:0.6B 模型本地性能媲美 32B 提示,内存仅 1/50 — yuntiandeng · 2026-09-21
- 个人 Agent 爆发成 NAND 闪存需求激增的最大推手 — zephyr_z9 · 2026-09-21
- 本地推理 VRAM 玄学:单卡 R9700 32GB 够用还是该趁涨价前加卡? — endgamedos · 2026-09-21