为继续预训练的小模型建评测:三层匹配度量知识内化
funJS · reddit · 2026-09-24
一位开发者分享了对小模型(Qwen 4B)做继续预训练(CPT)后如何构建评测的方法。目标是教会模型一个新领域(输出组成多段换乘的地铁行程),他用严格 JSON schema 约束模型输出,为提高 schema 遵循率又在 CPT 之后用 Unsloth SFT(alpaca 格式)做了微调。
评测不只用精确匹配,还测部分匹配(如只预测出部分路线)和语义匹配,综合衡量模型是否真正内化了领域知识。作者认为整体方法效果不错,详细内容见其博客文章。
所属事件:实战分享:为持续预训练的小模型设计评测方法(4 条相关)→
「编程与Agent」频道最新
- 有人用 Codex 10 分钟在旧游戏本上跑通 Qwen 加 Hermes Agent — markjeffrey · 2026-09-24
- Resend 接入 Stripe Projects,成开发者呼声最高邮件服务 — jeff_weinstein · 2026-09-24
- Opus 5.5 降价却改了行为,四处 agent 依赖点被破坏 — rseroter · 2026-09-24
- treg.to 技能整合 60 家数据源,27 人名单 20 封邮箱仅花 $0.58 — rohanpaul_ai · 2026-09-24
- Netflix 招 PhD 实习生,用 LLM Agent 自动化改进推荐系统 — tw_killian · 2026-09-24
- ChatGPT 语音模式接入工具实测:可打断可调 MCP,体验大幅升级 — athyuttamre · 2026-09-24