LongCat-Flash-Lite-Sparse 等多模型发布,支持百万上下文与稀疏注意力
LLMFan46 · reddit · 2026-08-30
社区作者发布了多个 GGUF 格式模型,核心亮点为 LongCat-Flash-Lite-Sparse。该模型基于 69B-A3B 架构,相比原版新增稀疏注意力机制并支持 100 万上下文长度,需使用作者 fork 的 llama.cpp 运行。同批发布的还有 Qwen3.8-27B、Qwen3.5-122B-A10B 的 Ultra Uncensored Heretic 版本,以及 Qwen3-Coder-Next 和 Laguna-S2.1 视觉模型。所有模型均提供多种量化格式(如 GPTQ-Int4, NVFP4)。
「Infra」频道最新
- DLSS 5 视频播放器实测:3090 Ti 运行缓慢 — fallengt · 2026-08-30
- 数据中心助推美国再工业化:从税收到就业的全面利好 — GavinSBaker · 2026-08-30
- 96GB 内存跑 Qwen3.8-Next-Flash:n-gram 表拆到 SSD 才是解法 — Iory1998 · 2026-08-30
- 越南 OneNexus 量化 GLM-5.3 至 MXFP4 — xiaosun86 · 2026-08-30
- Pi Agent 架构实战:Qwen 27B 担任 Oracle 指导开发 — Thrumpwart · 2026-08-30
- AI 将彻底重塑芯片设计经济逻辑 — ai · 2026-08-30