本地训练 Qwen 3.5 4B 新领域知识,如何设计评测验证内化效果
funJS · reddit · 2026-09-24
作者分享对本地小模型做继续预训练(CPT)时如何设计评测来衡量知识内化程度,案例是让模型输出 n 次换乘的地铁行程。
方法要点:
- 用严格 JSON schema 约束模型输出格式
- CPT 之后再做一轮 SFT 微调(Unsloth,alpaca 格式),提升模型稳定输出 schema 的能力
- 评测指标除精确匹配外,还测部分匹配(部分路线正确)与语义匹配
作者表示整体效果不错,详细内容见其博客文章。
所属事件:实战分享:为持续预训练的小模型设计评测方法(4 条相关)→
「模型」频道最新
- Opus 5.5 降价却改了行为,四处 agent 依赖点被破坏 — rseroter · 2026-09-24
- ChatGPT 语音模式接入工具实测:可打断可调 MCP,体验大幅升级 — athyuttamre · 2026-09-24
- 不是所有任务都要最强模型:私有、免费、极速也够赢 — ChrisUniverse · 2026-09-24
- 用户实测 Gemini Flash 3.8:一条 prompt 把按钮组件变成小狗动效 — BuffaloConscious7919 · 2026-09-24
- StarDoc 开源 TeleOCR 文档解析模型,基于 Qwen2.5-VL 冲上 HF 热榜 — StarDoc-AI · 2026-09-24
- 传闻 SSI 将于本月发布首个模型,因安全顾虑曾推迟 — iruletheworldmo · 2026-09-24