微调移除 GQA:Qwen 3.8 27B 实验与协作招募
Signature97 · reddit · 2026-09-02
作者尝试通过微调将 Qwen 3.8 27B 模型的 GQA(Grouped Query Attention)层替换为 KDA 层,以降低 KV Cache 开销。受 Arcee 公司 DistilKit 工具的启发,作者设计了策略并在约 26.2K tokens 上进行了初步实验,结果发现性能不佳,特别是在 GSM8K 数据集上表现大幅下降,复现了 Arcee 提到的挑战。由于个人算力资源有限,作者在 Reddit 发帖呼吁社区 pooling 资源,合作开展更大规模的微调实验。
「Infra」频道最新
- Gemini 推代理视频理解:成本降 66% 用量减 88% — MarioLucic_ · 2026-09-02
- 美国仍掌握全球大部分算力,优势巨大 — peterwildeford · 2026-09-02
- ARK 分析师:人均 GDP 每增加 1 美元就需 1 度电 — skorusARK · 2026-09-02
- 观点:农村美国因科技界糟糕的游说而抵制数据中心 — wordgrammer · 2026-09-02
- 英伟达下调利润目标以重置成本,押注执行力 — TansuYegen · 2026-09-02
- 寻求无需全天候开机的 Codex 长期运行托管方案 — ClinicalPulse · 2026-09-02