LongCat-Flash-Lite-Sparse 等多模型发布,支持百万上下文与稀疏注意力

LLMFan46 · reddit · 2026-08-30

社区作者发布了多个 GGUF 格式模型,核心亮点为 LongCat-Flash-Lite-Sparse。该模型基于 69B-A3B 架构,相比原版新增稀疏注意力机制并支持 100 万上下文长度,需使用作者 fork 的 llama.cpp 运行。同批发布的还有 Qwen3.8-27B、Qwen3.5-122B-A10B 的 Ultra Uncensored Heretic 版本,以及 Qwen3-Coder-Next 和 Laguna-S2.1 视觉模型。所有模型均提供多种量化格式(如 GPTQ-Int4, NVFP4)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →