Qwen3.8-27B 启用 DFlash2 跑满 256k 上下文
maddie-lovelace · reddit · 2026-08-21
在单张 RTX 5090 上测试 Qwen3.8-27B-UD-Q4KXL 模型,启用 DFlash2 草稿模型后,在 256k 上下文下解码速度提升约 2 倍(从 40 tps 提升至 75 tps),预填速度仅牺牲 15%。实测提供了具体的复现命令和参数配置。
「编程与Agent」频道最新
- 用户实测 Grok Bot:自主清理 10 万封邮件并批量退订 — elonmusk · 2026-08-21
- OpenAI 任命盐湖城首位 Codex 大使,推广 AI 编程 — paw_lean · 2026-08-21
- 人机协作新范式:现代团队如何运行 Agent 工作流 — JosephJacks_ · 2026-08-21
- PostHog 创始人谈 AI 转型:做睡眠中修复代码的「行动公司」 — ycombinator · 2026-08-21
- LangChain 将于 8 月 27 日举办 Agent 构建路演 — LangChain · 2026-08-21
- YC 项目 Qlo:用 AI Agent 替代 80% 的核保邮件处理工作 — ycombinator · 2026-08-21