Qwopus 3.8 27B Flash 发布:微调 Qwen3.8-27B,推理开销大降、速度提升 12.8%
EAccelerate_42 · x · 2026-09-04
基于 Qwen3.8-27B 的社区微调模型 Qwopus 3.8 27B Flash 在 Hugging Face 发布(Apache-2.0,GGUF),主打在保持通用能力的同时大幅压缩 agent 工作流的推理成本。
- 解码速度提升 12.8%,MTP 接受率达 80.7%,CoT 更简洁,有时较基座缩短 10 倍以上,并能自主决定何时多想、何时少想
- 在 Claude Code 等 agentic 工作流中放开思考预算也能流畅运行,实际墙钟时间表现突出:旧 V100 上约 37 tps,5090 开 MTP 约 100 tps
- 支持视觉、工具调用、代码生成等,面向本地推理与长链 agent 任务优化
「模型」频道最新
- Deep Learning Weekly 第471期:Claude Fable 5.1 发布与生产级 LLM 评测 — dl_weekly · 2026-09-05
- OpenAI 官员确认:Astra 纳入套餐正常用量,额度可 100% 划拨 — soumitrashukla9 · 2026-09-05
- 罕见病诊断基准 RareBench 横评:Claude Fable 5.1 居首,Nemotron 3 Ultra 得 0 分 — danielmckinn0n · 2026-09-05
- 曝 GPT-6 Astra 数学评测超闭源对手,爆料人称开源模型 18 个月内难企及 — inductionheads · 2026-09-05
- TheZvi 解读 Claude Fable 5.1 系统卡:200+ 页安全评估要点 — TheZvi · 2026-09-05
- COLM 论文:思维链看着可读不等于真的重要 — LauraRuis · 2026-09-05