Reddit 用户怒批 FP4 推理热潮:小模型 4bit 直接废掉
buttplugs4life4me · reddit · 2026-09-20
一位 Reddit 用户吐槽本地推理社区每天冒出各种「最快推理引擎」帖,但翻到帖子底部才发现只支持 NVFP4/MXFP4。作者认为这些优化在把已经最快的选项再快一点点的同时,输出质量往往严重劣化、幻觉频出。
作者的核心论点:大模型参数多、冗余大,4-bit 量化损失可以容忍;但小型稠密模型被压到 FP4 基本就完全废掉,模型会「1+1=3」,做不了正经事。恳请大家停止这种 FP4 军备竞赛。
「Infra」频道最新
- 传 Anthropic 训练算力强度与推理经济性落后于 OpenAI — teortaxesTex · 2026-09-20
- 6 张 V100 跑通 Qwen 3.8 Next:MTP 提速近一倍至 43 tok/s — Odd_Caterpillar_2994 · 2026-09-20
- Ben Bajarin:Agent 工作流将催生「Agentic 原生 CPU」新层级 — BenBajarin · 2026-09-20
- 3x 3090 本地跑 Qwen 3.8 Next Flash:3 比特量化体验堪比 Q8 — nicholas_the_furious · 2026-09-20
- 材料技术放缓芯片贬值,Beff:以为到了终局,坏消息在后面 — beffjezos · 2026-09-20
- Reddit 热议:AI Agent 运行时能不能搬到 Cloudflare Workers 等 Edge? — merlinofthewater · 2026-09-20