FLOPs 并非唯一指标:需关注字节传输与能耗
prateekj · x · 2026-08-21
FLOPs(每秒浮点运算次数)常被用来衡量处理器的原始计算速度和算力,但它只衡量了数学工作量,即模型执行了多少乘法/加法,并未告诉我们在硬件上实际执行这些计算的成本有多高。对于现代 LLM 推理,我们需要从三个层面思考:
- 每个 Token 的 FLOPs:衡量数学工作量,告诉我们算法需要多少算术运算。
- 每个 Token 传输的字节数:衡量系统工作量,告诉我们需要从 HBM 移动到芯片、从 SRAM 移动到计算单元、跨 GPU 等传输多少数据。
- 每个 Token 的焦耳数:衡量物理工作量,它涵盖了算术运算、内存移动、通信以及硬件的低效损耗。
「Infra」频道最新
- Humyn Labs 发布具身智能第一人称训练数据库 — testingcatalog · 2026-08-21
- 从第一性原理看:Etched 推理芯片的路径难以成立 — bingxu_ · 2026-08-21
- Waymo 揭秘车载计算架构:低延迟与冗余设计 — SuzKP · 2026-08-21
- AWS 发布企业级智能体扩展指南:避免厂商锁定的七大架构原则 — RexDouglass · 2026-08-21
- AWS发布企业级Agentic AI扩展指南:避免供应商锁定 — AWS ML Blog · 2026-08-21
- LLM 推理的四大反直觉现象:批处理、量化与推测解码的陷阱 — techNmak · 2026-08-21