在家用 4 张 V100 直播后训练 80B 模型:96 小时蒸馏 3340 条数据
jjusko20 · reddit · 2026-09-29
一位独立开发者正在家用 V100 上从 base 模型后训练出 AliceAI-Foundation-80B-A3B-Instruct,并开了直播展示训练实时状态。关键细节:
- 数据:用 Qwen 3.8 27B(medium thinking)做教师蒸馏,自建蒸馏引擎(兼容 OpenAI endpoint,可接任何模型);4 个实例 25tps 跑了约 96 小时,产出 3340 条样本——1760 条通用 instruct 对话 + 1580 条 agentic 工作数据(SWE、harness、终端等),给教师模型挂了 Python 沙箱模拟回合式开发,覆盖多种工具调用 harness 语法
- 训练方案:rank 16 QLoRA,只调 q/k/v/o proj;先跑 2 epoch SFT,预计 3-6 天,之后计划上 RL
- 作者不指望刷榜,目标是让模型在 harness 里正常跑工具调用后正式 bench
数据集计划放 HF,作者同时在找纽约的 ML 工程师工作。
「研究」频道最新
- 数学与理论计算机科学新预印本库 Hexagon 开放公测 — suchenzang · 2026-09-29
- JHU 学者于 HCOMP2026 谈人机协作中的锯齿边界 — windx0303 · 2026-09-29
- LayerSkip:单模型自推测解码,免掉独立草稿模型的推理加速框架 — burkov · 2026-09-29
- PolyXOR 夺 128 位哈希冠军,论文揭示快速哈希对抗样本风险 — thomasahle · 2026-09-29
- Anthropic 等联合办生物数据黑客松,48 小时挖掘真实数据洞见 — adityaag · 2026-09-29
- Hindsight 方法实践:让 Agent 从失败中学习而不违反策略 — nishithreddy · 2026-09-29