FreeToken:带宽自适应 MoE 推理框架
SteppenAxolotl · reddit · 2026-08-25
FreeToken 是一种面向边缘端的 MoE 高效推理框架,通过带宽自适应 CPU-GPU 执行和跨 Agent 轮次的语义感知缓存提升性能。
性能数据:
- Qwen3.6 35B:8GB RTX 4060 笔记本 @ 39 tok/s
- DeepSeek-V4-Flash 284B:RTX 5090 桌面 @ 22-25 tok/s
- GLM-5.2 753B:RTX PRO 6000 工作站 @ 15 tok/s
对比 Ollama,解码速度提升 3-4 倍,预填充速度提升 6-30 倍,允许在消费级硬件上运行官方 Checkpoint 的前沿模型。
所属事件:FreeToken 开源引擎:8GB 显存本地跑 290B MoE 模型(3 条相关)→
「Infra」频道最新
- AMD 展示内存架构设计,优化内存资源利用 — BenBajarin · 2026-08-25
- AMD 在 Hot Chips 介绍 MI455X GPU 与 Helios 机架方案 — firstadopter · 2026-08-25
- 即便竞品芯片免费,Nvidia 算力成本仍最低 — sinclairx · 2026-08-25
- 算力平台 Lium 对标 Vast/Runpod,宣称同配置免 KYC 且价格更低 — markjeffrey · 2026-08-25
- Vera Rubin 超级计算机冷却循环仅 10°C 温差 — beffjezos · 2026-08-25
- NVIDIA Rubin 的“功率平滑”技术改变数据中心经济 — BenBajarin · 2026-08-25