开发者从零后训练 Yandex 80B 模型:首轮 SFT 欠拟合的踩坑复盘
jjusko20 · reddit · 2026-10-05
Reddit 用户 jjusko20 汇报对 Yandex 开源的 AliceAI-80B-A3B-Base 做 instruct 后训练的第 4 次进展,目标是具备 agentic 工作与对话能力,并用 Qwen 3.8 27B 做浅层蒸馏来教链式推理。
进展与问题:
- 完成首轮 SFT,模型能学出链式推理并可对话
- 但明显欠拟合:初始 500 万 token 太窄,遇到与训练数据不完全匹配的模糊提问就输出乱码
- 判定 checkpoint 1 无用,不发布
下一步与工具:
- 把本地合成数据生成器从 80 tps 提到约 240 tps(支持多 base URL 拉取)
- 新增约 500 万 token 的通用 instruct 数据集(原版偏 coding),用更低学习率在 checkpoint 上续训
- 开源了自己写的 off-policy 蒸馏引擎 sftmill(GitHub),可从行为目标直接生成训练数据
「研究」频道最新
- Aeon 长文:大脑不处理信息,它根本不是一台计算机 — AnnaCiaunica · 2026-10-05
- Lobian 合作智能体不做效用最大化,难点在'如何自主决定合作' — RichardMCNgo · 2026-10-05
- ML 研究者:学微积分看似浪费时间,却是生涯最划算的投资 — TivadarDanka · 2026-10-05
- 港科大发布 LexAgentHallu:法律 Agent 幻觉要从全执行轨迹逐步定位 — jiqizhixin · 2026-10-05
- 零基础向视频系列:讲清线性代数在语言模型内部的真实作用 — AndyMasley · 2026-10-05
- Xaira 发布 X-Design:7 周拿到肿瘤靶点临床前先导抗体 — BoWang87 · 2026-10-05