Qwen3.8FlashNext 长上下文压缩时的冷 prefill 速度无人实测
Express_Quail_1493 · reddit · 2026-09-28
Reddit 用户求测:很多人晒 Qwen3.8FlashNext 的 decode 与 prompt prefill 速度,但没人分享在 harness 进行 128k 上下文压缩(compaction)时的 prefill 数据。发帖者想看部分 offload 下的冷 prefill 实测速度。
「Infra」频道最新
- 一个驱动开关让 AMD 双卡 Vulkan 推理提速最高 4 倍 — tabletuser_blogspot · 2026-09-28
- PrismML 三值压缩 Qwen3.8 27B 至 5.9GB,能力保留 98.2% — dl_weekly · 2026-09-28
- 开发者拟让 Codex 决定跑哪些测试,大幅削减 CI 成本 — sull · 2026-09-28
- 免费在线 LLM 原理全指南:从 token 到本地部署全链路 — JFPuget · 2026-09-28
- 向量数据库够用吗?Reddit 热议 Agent 生产级存储难题 — OkShirt9372 · 2026-09-28
- GPU 多到没处用:有人用 PTX 当词表预训练了一个基础模型 — rickasaurus · 2026-09-28