微调 Gemma 4 26B 提炼判决要旨,始终打不过基座模型
seruZ12 · reddit · 2026-08-20
Reddit 用户尝试微调 Gemma 4 26B A4B(base 与 IT 版本都试过),用 50 万份本地法院判决中约 20% 带「判决要旨」的高质量数据训练,让其自动生成判决书段落级法律要旨。结果在自建 LLM eval 上始终无法击败只用 prompt 的基座模型,唯一「赢」的场景是围绕特定抽取任务构建的 eval,但实际产出充满 padding 和泛化表述,不可用。
作者用 Claude vibe code 搭了整个流水线(unsloth + 租用服务器),怀疑自己犯了低级错误,向社区求助:26B 模型到底能不能学会这种复杂法律摘要任务,有哪些常见坑。
「研究」频道最新
- 开源 Ornith-1.5 发布:397B MoE 四项基准胜过 Claude Opus 4.8 — rohanpaul_ai · 2026-08-20
- FM-Bench 发布:评测 LLM 智能体 20 年长期管理能力 — Tianyou Wang · 2026-08-20
- SkillForge:通过自蒸馏技能解决项目特定 Bug — SJTU · 2026-08-20
- 研究:循环语言模型提升组合式工具调用能力 — Andrei Cristian Popescu · 2026-08-20
- 新论文提出基于 Itô 签名的动态对冲可解释框架 — chaumian · 2026-08-20
- 新论文提出用强化学习实现多级市场做市策略 — chaumian · 2026-08-20