用 Claude 标注 700 篇判例,蒸馏成两个 287M 小模型做文档抽取
SignificantZebra5883 · reddit · 2026-10-04
作者要把约 500 万份法院判决转成结构化图谱,但不想每篇都跑大模型,于是采用「LLM 标注 + 小模型蒸馏」方案:
- 结构设计:每份判决输出实体(人/机构/法律/文件,带 id、9 种类型、724 种细分 kind)、动作(归一化动词、是否法院裁定)和数值(金额/日期等归一化形式)三类节点
- 第一步:用 Claude Sonnet 对约 700 份判决按 4 句窗口打标,严格 JSON schema,带编号词位置、二次漏检补标、跨窗口实体 id 一致性,再加约 25 条代码规则清洗;kind 自由文本经手工归并得 724 类
- 第二步:微调 287M 的 GLiNER(span 标注模型),9699 个窗口、20.7 万标注短语;改造训练器只把标注处当正样本,bf16 会 NaN 改用 fp32 全量微调,双学习率 3e-5/5e-4,取第 9-14 epoch 权重平均
- 第三步:再训一个 287M 多选题模型做指代合并、kind 分类、动作去重与动词归一(24.7 万条训练问题,由 LLM 标签自动生成)
结论:整体可行但效果仍略低于直接用 LLM,作者在帖中求证蒸馏管线是否有问题。这是一份难得的完整蒸馏实操复盘,包括标注、训练细节与踩坑。
「研究」频道最新
- 开源 Hyper-Connection Factory:一个底座统一实测 11 种残差连接变体 — ChengleiSi · 2026-10-04
- Arthur Gretton 周一开讲:MMD 上的梯度流方法 — ArthurGretton · 2026-10-04
- Tartan IMU 挑战赛收 131 队提交,前十团队将公开方案 — GhaffariMaani · 2026-10-04
- LLM 工作原理拆解:从嵌入生成到自回归循环的三层机制 — gerardsans · 2026-10-04
- 长文质疑「柏拉图表征假说」:统计趋同被误读为形而上学真理 — gerardsans · 2026-10-04
- Daimon 触觉世界模型亮相 IROS:机器人穿珠靠手感而非视觉 — CyberRobooo · 2026-10-04