用 20 亿法律语料续训 9B 模型,如何还原 Instruct 与思考能力
SignificantZebra5883 · reddit · 2026-10-07
作者设想对 Qwen3.5-9B 在 20 亿 token 法律语料上做 continued pretraining,并抛出一串方向性问题:
- 如何把 CPT 后的 base 模型还原为 Instruct + thinking?是否只能从 instruct 模型蒸馏?
- 欧洲语言的高质量问答数据集怎么选,9B 规模能否支撑 agentic 用法?
- 他的 harness 让模型输出 Python 代码、内置 vectorsearchlaws() 与 graphsearch() 等函数,能否让模型内化「搜索直觉」?
- 手头有大量法院判决、注释、立法等原始数据但缺 gold 数据,能否合成训练数据并在自建 harness 里做 RL?最新的 agentic RL 技术有哪些?
这是一个法律 AI 领域微调路径的求方向帖,适合有训练实践的人回答。
「研究」频道最新
- 研究员观点:混合模型下游扩展更优,但全局注意力仍不可少 — kalomaze · 2026-10-07
- 模型如何学出隐私信号:推理压力是更强的信息不对称 — kalomaze · 2026-10-07
- 数学家人手不足应对 AI 证明浪潮,人机半人马协作或成解法 — bradneuberg · 2026-10-07
- Judea Pearl 点赞《Crush Coarse》论文,称其值得读 — yudapearl · 2026-10-07
- ProofAtlas 发布 LLM 评估的 500 大数学开放问题排名 — RexDouglass · 2026-10-07
- COLM 2026 杰出论文奖揭晓,CMU 团队获奖致谢 — dan_fried · 2026-10-07