求推荐适合低延迟聊天的开源模型
dnivra26 · reddit · 2026-08-17
用户询问适合低延迟聊天代理的开源 LLM,目前看到很多针对编码和长任务的模型,但缺少像 Flash 这类低延迟的聊天模型。用户目前拥有 8 张 H100 服务器用于生产环境,正在使用 Qwen3 235B。
「模型」频道最新
- 用户实测:Gemini 3.7 Flash 多模态理解大增 — melvinjohnsonp · 2026-08-17
- Qwen3.8 蒸馏版 9B/4B/2B 发布:MMLU 跑分翻倍 — alejandroll10 · 2026-08-17
- 爆料:新版 Claude/GPT API 强制 Temp 为 1 — andersonbcdefg · 2026-08-17
- Grok观看视频后学到了什么? — Scobleizer · 2026-08-17
- 实测:Gemini 3.7 Flash 多模态与指令处理大飞跃 — haider1 · 2026-08-17
- Codex 将迎来更新:宣称接近 100% 可靠且开源 — soumitrashukla9 · 2026-08-17