整理 30 道 LLM 推理与服务面试题
techNmak · x · 2026-08-21
整理了 30 道涵盖 LLM 推理与服务系统侧的面试题,旨在深入理解生产环境运行大模型的机制。
主要板块:
- 推理基础:Prefill vs Decode、计算/内存边界失效场景、延迟与吞吐指标。
- KV Cache 与调度:内存计算、MHA/MQA/GQA 服务差异、Continuous Batching、PagedAttention 原理、KV Offload 策略。
- 推理优化:量化策略与性能关系、Speculative Decoding 接受机制、FlashAttention、CUDA Graphs。
- 分布式与生产:张量/流水线并行、解耦 Prefill/Decode、容量规划、长上下文推理、MoE 服务。
附带了部分问题的面试官笔记(追问与薄弱信号),强调性能优化取决于具体资源瓶颈。
「Infra」频道最新
- Rackspace 联手 AMD 部署 30MW 私有云 AI 算力 — DavidLinthicum · 2026-08-21
- 开发者断言 Modal 将被大厂收购:Agent 科学计算的最大解锁 — iskander · 2026-08-21
- Meta 每年向微软 Azure 费数亿美元算力 — dinabass · 2026-08-21
- Hugging Face 发布 LFM2.5-DSpark,推理速度最高提升 3.2 倍 — Hugging Face Blog · 2026-08-21
- AMD 与 HPE 建造 Lux 超算,美能源部 milestone — wkmyrhang · 2026-08-21
- Qwen3.8-27B 单卡跑出 129.8 tok/s,vLLM 胜出 — MaziyarPanahi · 2026-08-21