伯克利开源 FreeToken:千元的 4060 笔记本跑 35B 模型
Yuchenj_UW · x · 2026-08-22
UC Berkeley Sky Lab 开源 FreeToken,大幅提升消费级 GPU 上的本地推理速度:单张 RTX PRO 6000 工作站即可让 753B 的 GLM-5.2 跑到 14.9 tok/s,8GB 显存的 RTX 4060 笔记本(约 1000 美元)能以 39.3 tok/s 运行 Qwen3.6-35B,RTX 5090 可跑 DeepSeek-V4-Flash 284B(22-25 tok/s)。
关键点是使用官方权重、无需极端量化,速度比 Ollama 快 2-4 倍,可以在本地零成本接入 Claude Code 或 Codex 使用前沿模型。
「Infra」频道最新
- MCP 并非取代 API,而是改变了 API 的设计受众 — kush_patil · 2026-08-22
- Qwen3.8-27B 推出 DFlash2 投机解码 GGUF 量化版 — incoai · 2026-08-22
- Woolly 让 Qwen3-8B 数理解码提速 2-3 倍 — bosmeny · 2026-08-22
- 观点:禁数据中心将致未来二十年经济低迷 — GabGarrett · 2026-08-22
- Vercel修复TLS碎片问题,所有网站恢复正常 — uwukko · 2026-08-22
- 观点:数据中心工人和居民应获得代币分红 — beffjezos · 2026-08-22