实战复盘:给持续预训练后的小模型设计 evals 的方法
funJS · reddit · 2026-09-24
作者分享给本地小模型(Qwen 3.5 4B)做领域持续预训练(CPT)后设计评测的经验,以「输出 n 次换乘地铁行程」任务为例:
- 用严格 JSON Schema 约束模型输出的行程结构
- CPT 之后追加 Unsloth SFT 微调(alpaca 格式),显著提升模型稳定输出 schema 的能力
- 评测除精确匹配外,还引入部分匹配(预测出部分路线)和语义匹配,更全面衡量知识内化程度
作者表示该方法效果良好,详细内容见其博客文章。
所属事件:实战分享:为持续预训练的小模型设计评测方法(4 条相关)→
「研究」频道最新
- 一张图讲清梯度下降与反向传播:让误差信号流回每个参数 — alfcnz · 2026-09-24
- 手推多层网络学习信号:为何交叉熵与平方误差梯度等价 — alfcnz · 2026-09-24
- 从感知机到多层网络:公路自动驾驶教学线程讲透表征学习 — alfcnz · 2026-09-24
- 给果蝇连接组接上眼睛再喂 LSD:模拟视觉神经活动实测数据 — Merzmensch · 2026-09-24
- Anthropic 生物学实验室首秀引质疑:77 agent 小时算多还是少? — basedjensen · 2026-09-24
- 不预测产率预测速率:ML 把镍催化偶联变成动力学地图 — bravo_abad · 2026-09-24