论文称只训练一层 Transformer 也能匹配全参数 RL
RisingSayak · x · 2026-07-21
一篇新论文提出,Transformer 的强化学习收益可能主要集中在少数几层上。 - 作者检验了:**只训练一层 Transformer**,能否接近全参数 RL 训练的效果。 - 他们在 7 个模型上发现了稳定模式:**大约位于网络深度 40%–60% 的层**贡献最高。 - 配图中的结果显示,只训练这些高贡献层,在数学基准上可以 **匹配甚至超过全参数 RL**,而且所需可训练参数更少。
「研究」频道最新
- OpenForecaster 用每日新闻提升语言模型预测能力 — Cohere_Labs · 2026-07-21
- 商汤在 WAIC 2026 推出 U1 Pro 并开源 5000 万样本视觉数据集 — 机器之心 · 2026-07-21
- Baseten 研究发现,LLM 新事实写入权重后很脆弱 — alex_verem · 2026-07-21
- Kimi K3 与 Fable 5 的差距已不像过去那样明显 — FinanceYF5 · 2026-07-21
- uv-scripts/ocr重回HF热门榜并新增JSON模型选择目录 — vanstriendaniel · 2026-07-21
- DeepSearch-World 用 42 万可验证问答训练网页智能体 — HKUST · 2026-07-21