用 SVD top-k 初始化 LoRA 适配器,还能改善下游 RL 训练
simonguozirui · x · 2026-09-17
Trajectory Labs 团队分享了一项实践研究:将 LoRA 适配器用预训练权重 top-k SVD 分量初始化(即 PiSSA,2024),此前已知对 SFT 有益,他们现在证明这同样能改善下游 RL 训练效果。该想法最早来自 John Schulman 的《LoRA Without Regret》博客。团队发布了带可视化讲解的博客说明初始化为何重要,并已将代码合入 SkyRL,读者可自行复现实验。作者还指出后续方向:LoRA-GA 值得关注,在对齐方面或许可以选取与对齐重要方向正交的训练方向。
「编程与Agent」频道最新
- Zilliz CTO 提出「One Data、One Index」重构 Agent 检索边界 — J_Luan_ · 2026-09-17
- 开源 Nelson MCP 让 AI Agent 直接在 LibreOffice 内读写文档 — quazarzero · 2026-09-17
- 开源 LLM 可观测工具 Opik 获 2.2 万星:调试、评测、监控一体 — dl_weekly · 2026-09-17
- 希思罗机场瘫痪中,Muse 智能体找到航站楼酒店并自动填好预订表 — armand_ruiz · 2026-09-17
- 评测结果不该被基础设施左右:墙钟时间惩罚差基建部署 — xeophon · 2026-09-17
- 评测成绩不该被基建绑架:turn 数难以定义成 agent 评测死结 — langstonnashold · 2026-09-17