FreeToken 实测:4090级显卡跑35B模型达100 tok/s
ViRROOO · reddit · 2026-08-22
新项目 FreeToken(论文 arXiv:2608.16157,GitHub: FlashML-org/FreeToken)发布,作者在本地做了初步测试。
测试环境:RTX 5080(16GB 显存)+ 64GB DDR6 内存 + AMD Ryzen 9 9950X3D,在 QWEN3.6-35B-A3B NVFP4 量化模型上达到 100 tokens/s 的生成速度。
作者认为该项目表现不错,并向社区征集更多实测反馈。
所属事件:伯克利开源 FreeToken:消费级 PC 轻松跑百亿级 MoE 模型(6 条相关)→
「Infra」频道最新
- 伯克利 MIT 推 FreeToken:消费级 GPU 跑 284B 模型 — solyarisoftware · 2026-08-22
- 美 AI 产业经济模式承压:订阅收入难覆算力成本,数据中心建设屡屡受阻 — Minimum_Name9115 · 2026-08-22
- Starcloud在卫星上跑大模型:先在轨训练小模型,H100已上太空 — emmanuelvivier · 2026-08-22
- 如何让 llama.cpp 正确支持多 GPU 显存 — erazortt · 2026-08-22
- Ox Alpha 每天送出 100T tokens:算力成本达百万美元级 — teortaxesTex · 2026-08-22
- 企业 OpenAI 账单失控,求荐统一 AI 网关方案 — HurryOrganic · 2026-08-22