给本地微调小模型做 Eval:JSON Schema + 三级匹配验证法
funJS · reddit · 2026-09-24
作者分享对 Qwen 3.5 4B 做持续预训练(CPT)注入新领域后的评测经验:
- 任务是让模型输出构成 n 次换乘地铁行程的 travel legs,用严格的 JSON Schema 约束输出
- 为提升 schema 输出可靠性,在 CPT 后用 Unsloth SFT(alpaca 格式)再做一次微调
- 评测除精确匹配外,还测量部分匹配(如预测出部分路线)和语义匹配
作者称该方法整体效果良好,详细流程见其文章链接。
所属事件:实战分享:为持续预训练的小模型设计评测方法(4 条相关)→
「编程与Agent」频道最新
- Zilliz CTO:Agent 让企业数据层问题无处遁形 — No_Engineer_1224 · 2026-09-24
- $0.072/时的16GB云VM跑Android模拟器+Chrome,常驻Agent工作流新选择 — cem2ran · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- 把 Jev 接进 Mythic:用大模型给红队命令的 OPSEC 强度打分 — dyn___ · 2026-09-24
- Ethan Mollick 用 Claude 多智能体协作复刻童年老游戏 Rescue Raiders — emollick · 2026-09-24
- YC CEO Garry Tan:用 Capy 后 PR 速度比裸用 Codex 快 4 倍以上 — garrytan · 2026-09-24