微调 Qwen3-14B 做金融推理:FinQA 涨到 12.6%,六任务均分反降
finxapp · reddit · 2026-10-10
MaxInt 团队开源了两个金融领域适配的 Qwen3-14B 检查点,并公开了完整的权衡数据:
- FinQA 准确率从 1.9% 提升至 12.6%
- 但六任务平均分从 0.441 下降到 0.399,金融情感分析和命名实体识别出现明显回退
- 团队文档化了训练管线、数据过滤、13-gram 基准去污染流程,以及一个可能影响评估的输出格式问题
作者向领域适配方向的同行提问:下一步应优先做 chat-template 感知的重新评估、纯 SFT(不做持续预训练),还是优化训练数据配比?欢迎挑战他们当前解读的证据。
「研究」频道最新
- NYU 与亚马逊论文:蒸馏 6 条精选技能可抵 11 倍大的技能库 — rohanpaul_ai · 2026-10-10
- Apple ML 招博士实习生,攻关高效多模态与视频理解 — CSProfKGD · 2026-10-10
- PostTrain Agent 全自动后训练拿 PostTrainBench 榜首,距人类专家仅差 4.5 分 — jiqizhixin · 2026-10-10
- kissing number 下界刷新:D19-31 多维新纪录开源可验证 — felpix_ · 2026-10-10
- 数学家担忧「问题被解决」定义进步,AI 时代这一隐忧成真 — _onionesque · 2026-10-10
- UIUC×谷歌推出BudgetPix:单模型按图像复杂度自适应算力,token可降至10% — CSProfKGD · 2026-10-10