LFM2-350M 量化版在 RTX 5090 上跑出 170 万 token/s 解码速度

AlpinDale · x · 2026-09-04

Localmaxxing 榜单显示,Liquid AI 的 LFM2-350M 采用 NVFP4A16 量化后在单张 RTX 5090(32 GB)上达到约 170 万 token/s 的解码速度。AlpinDale 转发时调侃这一速度已快到"不如直接读 /dev/urandom",凸显本地小模型推理速度已接近随机数据流的量级。这条帖子主要是一句吐槽加榜单链接,榜单页面细节(具体延迟、显存占用等)在链接里,正文未展开。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →