LFM2-350M 量化版在 RTX 5090 上跑出 170 万 token/s 解码速度
AlpinDale · x · 2026-09-04
Localmaxxing 榜单显示,Liquid AI 的 LFM2-350M 采用 NVFP4A16 量化后在单张 RTX 5090(32 GB)上达到约 170 万 token/s 的解码速度。AlpinDale 转发时调侃这一速度已快到"不如直接读 /dev/urandom",凸显本地小模型推理速度已接近随机数据流的量级。这条帖子主要是一句吐槽加榜单链接,榜单页面细节(具体延迟、显存占用等)在链接里,正文未展开。
「Infra」频道最新
- AMD 发布 Threadripper Halo Station:96 核 CPU 配 576GB HBM3E — ccerrato147 · 2026-09-04
- 流体基础模型 AeroJEPA 正式加入 NVIDIA PhysicsNeMo 生态 — ricardovinuesa · 2026-09-04
- 2-2.5千欧预算搭建本地 AI 工作站:律师隐私 RAG 与 agentic coding 选型 — whatyathinkk · 2026-09-04
- 双卡 3090 够用吗?本地 LLM 玩家讨论是否再堆两张 — Blues520 · 2026-09-04
- NousResearch 携手 NVIDIA:Hermes Agent 实现一键本地部署 — lifebypixels · 2026-09-04
- 受监管行业求购 AI Gateway:Okta 集成加运行时策略执行 — IrrepressibleInk · 2026-09-04