Ling-3.0-flash-dspark 开源,4 卡 Blackwell 跑出 1120 tok/s
AdinaYakup · x · 2026-08-22
开源了专为 Ling-3.0-flash 构建的 DSpark draft 模型。在 4 张 NVIDIA Blackwell GPU 上,batch 1 的条件下,该模型在 1000 个请求中实现了 1120 tok/s 的速度,平均 TPOT 为 0.78ms,接受长度为 9.95。
「模型」频道最新
- 难以微调模型避免使用不必要的连字符 — ivan_bezdomny · 2026-08-22
- 实测:Qwen3.8-27B Q6 代理编程表现强劲 — Ok_Ninja7526 · 2026-08-22
- 用户测试模型生成刻板印象:犹太人形象相对温和 — doodlestein · 2026-08-22
- EMNLP 2026 论文:RAG 检索思维轨迹提升推理 43% — matei_zaharia · 2026-08-22
- 实测Qwen-3.8 27B无审查版:可讨论历史人物而不被说教 — doodlestein · 2026-08-22
- llama.cpp 接入 280B 参数多模态模型 dots3-note — jacek2023 · 2026-08-22