LiteRT-LM 在 Intel Arc 核显上比 llama.cpp 快 3.5 倍
hi-brawlstars · reddit · 2026-07-28
有用户在 Intel Arc 核显 上把 Google LiteRT-LM 和 llama.cpp 做了头对头对比,测试模型是 Gemma-4 E2B。
结果要点
- Prompt prefill / TTFT:LiteRT-LM 明显更快,最高达到 3.5× 吞吐优势。
- 在 32k token 场景下,首 token 时间从 llama.cpp 的 210 秒 降到 80 秒,节省约 2.1 分钟。
- 解码速度:llama.cpp + MTP 仍更快,约 30 tok/s;LiteRT-LM 约在 20–23 tok/s。
测试信息
- 硬件:Intel Core Ultra 7 155U、Intel Arc iGPU、16 GB LPDDR5x、Windows 11
- 模型格式:Q4KM GGUF 对比 auto-int4 .litertlm
- 帖子还给出了可复现的 benchmark 命令。
核心结论是:如果目标是降低长上下文的提示词等待时间,LiteRT-LM 在这套消费级 Intel 核显环境里表现非常强。
「Infra」频道最新
- RTX 5090 在欧洲又涨 €1,061,本地推理需求仍在推高价格 — egudegi · 2026-07-28
- GitHub 仓库每日更新 OpenAI GPTBot 等主要云与爬虫 IP 段 — tom_doerr · 2026-07-28
- 美国最大电网拟要求数据中心全额承担用电成本 — pstAsiatech · 2026-07-28
- 一条反击:数据中心债务并不是新次贷危机 — JOBhakdi · 2026-07-28
- Nvidia 德州数据中心 15 年租约为 196 亿美元 — firstadopter · 2026-07-28
- 分析师称 Google 到 2028 年离不开 Intel 供给 — zephyr_z9 · 2026-07-28