复现 Nanbeige 三重环架构,Qwen3.5-9B 自我循环实验
Important-Farmer-846 · reddit · 2026-08-23
一位开发者受 Nanbeige 4.2/4.5 架构启发,尝试在 Qwen3.5-9B 模型中引入“三重环”结构,探索模型通过自我循环提升表征能力的效果。
实验方法:
- 最初尝试在中间层使用 DeltaNet,但发现会导致遗忘和幻觉。
- 改回全 softmax attention,并修正了学习率调度(为循环层设置专用低学习率),使循环层真正参与推理而非仅仅“润色”。
- 使用 Modal 平台提供的免费 GPU 资源,通过知识蒸馏(Teacher 为 Qwen2.5-72B,注:原文写 Qwen3.8-27B 可能有误)在推理数据集上训练。
- 因预算不足,训练在约 1500 万 token 后提前停止(未完成 LR 衰减)。
实验结果:
- 提升:数学 (+20%)、长上下文 (+14%)、指令遵循 (+20%)、对改写问题的鲁棒性 (+62%)。
- 下降:推理 (-10%)、翻译 (-15%)、编码 (-2%)。
- 作者认为推理能力下降主要源于训练未完成(缺乏 LR decay)导致的特定失败模式(如跳过步骤、重复循环),而非架构天花板。
该模型目前仅为概念验证,并非最终产品,但证明了循环架构在正确训练下的潜力。
「研究」频道最新
- 教你 5 步用 Claude Code 构建高质量 AI 评估 — petergyang · 2026-08-23
- AI 评估专家:自底向上评估很难,AI 不擅长 — petergyang · 2026-08-23
- 手算图卷积网络:12 步搞懂 Transformer 表亲 — ProfTomYeh · 2026-08-23
- Napster 全面转型 AI 代理,暴露 LLM 训练数据过时的硬伤 — Tanmay_Vermaa · 2026-08-23
- Best-of-N 采样实测:数学题准确率提升至 65% — SergioPaniego · 2026-08-23
- ICML 2026 论文:OpticalDNA 借鉴 OCR 将基因组转为 2D 图像 — jiqizhixin · 2026-08-23