为继续预训练的小模型建评测:三层匹配度量知识内化

funJS · reddit · 2026-09-24

一位开发者分享了对小模型(Qwen 4B)做继续预训练(CPT)后如何构建评测的方法。目标是教会模型一个新领域(输出组成多段换乘的地铁行程),他用严格 JSON schema 约束模型输出,为提高 schema 遵循率又在 CPT 之后用 Unsloth SFT(alpaca 格式)做了微调。

评测不只用精确匹配,还测部分匹配(如只预测出部分路线)和语义匹配,综合衡量模型是否真正内化了领域知识。作者认为整体方法效果不错,详细内容见其博客文章。

所属事件:实战分享:为持续预训练的小模型设计评测方法(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →