单张 RTX 5090 跑 Qwen3.8-Flash-Next 达 68.3 tok/s,FreeToken 本地推理方案亮相

matei_zaharia · x · 2026-09-05

UC Berkeley Sky Lab 的 Shuo 展示了 FreeToken 本地推理方案:Qwen3.8-Flash-Next 在单张 RTX 5090 上达到 68.3 tok/s,无需极端量化或投机解码。

视频中演示用一个 prompt 生成可玩的 Minecraft 风格世界,并在 5090 桌面上用 FreeToken 在 10.5 分钟内修复一个真实 bug。Matei Zaharia 转发,称更强开源模型加新推理系统意味着强大的本地 AI 时代即将到来。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →