Qwen 官方指南:调节推理深度与 1M 上下文扩展
solyarisoftware · x · 2026-08-15
Qwen 官方发布 Qwen3.8-27B 实践指南,重点介绍两项技术:一是调节模型的“推理深度”,二是利用 YaRN 技术将原生的 262K 上下文扩展至 1M tokens。文章还提供了 vLLM、SGLang、TokenSpeed 和 Unsloth 的部署参考。
「Infra」频道最新
- NVIDIA 开源 NeMo Switchyard,智能体可跨模型路由 — NVIDIAAI · 2026-08-15
- 英伟达开源 NeMo Switchyard,支持智能体模型动态路由 — NVIDIAAI · 2026-08-15
- Vercel 被评为全球最快的 AI Gateway 基础设施 — cramforce · 2026-08-15
- mcpp:自动从代码生成 MCP 服务器的 C++ 库 — karurochari · 2026-08-15
- RTX 3090 跑 Qwen 3.8 27B 约 35 t/s — cviperr33 · 2026-08-15
- CME 推出英伟达 H100 算力期货,视算力为 AI 时代货币 — AccBalanced · 2026-08-15