实战分享:为持续预训练的小模型设计评测方法

一位开发者分享对本地 Qwen 3.5 4B 小模型做持续预训练(CPT)注入新领域知识后如何设计评测的经验。他以「输出 n 次换乘地铁行程」为案例任务,用严格的 JSON Schema 约束模型输出 travel legs,并采用三级匹配验证法度量知识内化程度,为社区提供了衡量小模型继续预训练效果的可操作方案。

2026-09-24 ~ 2026-09-24 · 4 条相关

另有 2 条近重复转述:funJS · funJS