Qwen3.8-27B 在 Kaggle 免费 TPU 跑出 130 tok/s,全程开源
A-Rahim · reddit · 2026-09-04
作者花一周把 Qwen3.8-27B(bf16、无量化)跑在 Kaggle 免费 TPU v5e-8 上,并暴露为 OpenAI 兼容端点:
- 单流 130 tok/s(MTP,关闭后约 78);8 流合计 540 tok/s
- Prefill 吞吐 10,300 tok/s:105k token 提示约 10 秒,225k 提示约 28 秒
- 支持完整原生 262,144 上下文
- 从点运行到端点上线约 20 分钟(经 Cloudflare tunnel)
仓库与 Kaggle Notebook 均已公开,意味着可以在完全免费的算力上自托管长上下文大模型 API。
「Infra」频道最新
- 研究称让 AI 造 App 的环境成本可达快速提问的 1 万倍 — shiringhaffary · 2026-09-04
- 本地 AI 服务器噪音救星:主板 BMC 带外管理调风扇转速 — HankYeomans · 2026-09-04
- Qwen3.8 27B 上线 Cerebras,推理速度高达 1500 tokens/s — gibbonwalker · 2026-09-04
- DiffusionGemma-26B-A4B 上线:单张 B200 跑块扩散解码,800+ tok/s — TheMoonMidas · 2026-09-04
- Databricks 从追踪数据挖出每年 120 万美元 AI 浪费 — matei_zaharia · 2026-09-04
- Neon 架构奠基 Lakebase,Databricks 在 VLDB 大会发表 — matei_zaharia · 2026-09-04