微调移除 GQA:Qwen 3.8 27B 实验与协作招募

Signature97 · reddit · 2026-09-02

作者尝试通过微调将 Qwen 3.8 27B 模型的 GQA(Grouped Query Attention)层替换为 KDA 层,以降低 KV Cache 开销。受 Arcee 公司 DistilKit 工具的启发,作者设计了策略并在约 26.2K tokens 上进行了初步实验,结果发现性能不佳,特别是在 GSM8K 数据集上表现大幅下降,复现了 Arcee 提到的挑战。由于个人算力资源有限,作者在 Reddit 发帖呼吁社区 pooling 资源,合作开展更大规模的微调实验。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →