用 DAgger 式迭代采集,把模型蒸馏到 2B 跑在消费级 GPU
Kangwook_Lee · x · 2026-09-29
作者分享了一套把大模型压缩到消费级 GPU 可运行的完整流程:
- 借鉴 DAgger 思路:先采集轨迹,对轨迹做纠正后继续训练模型。
- 训练完成后,把新模型部署回 PC bang(网吧)场景做下一轮数据采集,如此反复迭代。
- 最终通过蒸馏(SFT、off-policy KD,随后是 agentic OPD)把模型一路压到 2B 规模,使其能在消费级 GPU 上运行。
核心是「部署—采集—纠正—再训练」的闭环,而非一次性离线蒸馏。
所属事件:Kangwook Lee 团队租韩国网吧招千人陪练,蒸馏 2B 模型实现端侧游戏 AI Ally(5 条相关)→
「编程与Agent」频道最新
- 阶跃联创朱亦波提出 KITE:把 PD 分离思路引入训练,扩展 Agentic LLM — teortaxesTex · 2026-09-29
- LangChain 团队分享 Agent 开发实践,不用 LangChain 也值得看 — js_craft_hq · 2026-09-29
- CS 学生复盘实习:让 agent 真动手后,我手写了一堆脆弱的防护检查 — Professional-Mine681 · 2026-09-29
- WebBrain:开源本地浏览器 Agent,配 450M 浏览器专用小视觉模型 — ButtercupLyn100 · 2026-09-29
- 第三方实测 NVIDIA OpenShell:默认策略 0/10 泄密,但自动批准 12/12 漏数据 — No-Peanut-6988 · 2026-09-29
- Sonnet 5.5 一条 prompt 一键复刻月入 10 万美元的应用 — PrajwalTomar_ · 2026-09-29