单张 RTX 5090 跑 Qwen3.8-Flash-Next 达 68.3 tok/s,FreeToken 本地推理方案亮相
matei_zaharia · x · 2026-09-05
UC Berkeley Sky Lab 的 Shuo 展示了 FreeToken 本地推理方案:Qwen3.8-Flash-Next 在单张 RTX 5090 上达到 68.3 tok/s,无需极端量化或投机解码。
- 使用 RadixArk 经 GB300 验证的 NVFP4 生产级 checkpoint
- 仅需 63GB 主机内存,比该模型 1-bit 量化所需还少
- 51GB 的 n-gram 表放在 NVMe 上,吞吐损失仅约 0.5%
视频中演示用一个 prompt 生成可玩的 Minecraft 风格世界,并在 5090 桌面上用 FreeToken 在 10.5 分钟内修复一个真实 bug。Matei Zaharia 转发,称更强开源模型加新推理系统意味着强大的本地 AI 时代即将到来。
「Infra」频道最新
- 戴尔交付全球首批 NVIDIA Vera Rubin NVL72 机架至 CoreWeave — rohanpaul_ai · 2026-09-05
- 巴拉圭部署 1600 套 Starlink 套件,惠及超 5 万名师生 — elonmusk · 2026-09-05
- 晶圆键合冷知识:±0.1°C 控温与静电卡盘如何成就 AI 芯片 — bookwormengr · 2026-09-05
- 光刻机晶圆台为何不用齿轮:气浮与磁悬浮实现纳米定位 — bookwormengr · 2026-09-05
- FrankenTTS:纯 Rust 移植 Qwen3-TTS,浏览器本地克隆声音 — BLUECOW009 · 2026-09-05
- ngrok 发布 GOPHRS 网关:AI 网关迁移成强制项 — anthara_ai · 2026-09-05