RTX 4090 实测四款开源决策模型:Laya 最快,Lev 最准但慢 13 倍
Fun-Meaning-6474 · reddit · 2026-10-09
作者对近两周涌现的四款开源决策模型(Laya、Liquid d1 3B、Cloudflare Clef-Flash 9B、Interfaze Lev 4B)在单张 RTX 4090 上做同任务横评:逐词读 9 篇维基百科蜈蚣条目并标注蜈蚣名称。
结果要点
- 速度:Laya(BF16 GGUF + llama.cpp)每词 p50 仅 3.9ms,32 秒处理约 7980 词,最快;d1 3B 为 6.0ms。
- 准确性:Lev 4B 抓取率最高(83%)、误选仅 4 次,但每词 51ms,比 Laya 慢约 13 倍(部分因其跑 PyTorch 自建服务而非 llama.cpp,且对 CPU 敏感);Clef-Flash 抓取率仅 36% 但几乎不误报。
- 注意:表中 95%+ 的 accuracy 有水分——回答 no 也算对,真正该看抓取率与误报数。
作者结论:Laya 综合最快且易微调,是首选。文中给出完整复现配置(llama.cpp b11495、CUDA 12.8、-ngl 99、各模型量化文件与引擎)。
「Infra」频道最新
- AI 芯片设计公司 Phinity 数月内从零做到八位数 ARR — prateekj · 2026-10-09
- DGX Spark 价格被炒上天,转帖直指涨价内幕 — natesiggard · 2026-10-09
- Modal 推出 LLM Engine Advisor:几条约束一键选出推理引擎与配置 — charles_irl · 2026-10-09
- LFM 2.5 5.4B 被看好适合笔记本本地运行 — Aggravating-Push-207 · 2026-10-09
- Architect Fi 推出 Liquid Inference,700+ 模型按每条 prompt 最低价竞价路由 — markjeffrey · 2026-10-09
- lithos-metal 开源:M5 Max 上单用户峰值 200+ tokens/s 跑 Qwen3.8-27B — JiaZhihao · 2026-10-09