500 美元 RL 训练 4B 模型,金融问答反超 235B 大模型
AI Engineer · youtube · 2026-10-10
Snorkel AI 研究科学家 Charles Dickens 在 AI Engineer 大会分享:Snorkel 与 UC Berkeley Sky Computing Lab 用开源 rLLM 框架和强化学习,训练了一个 Qwen3 4B 模型,在真实金融问答上以约 60% 准确率击败了 235B 参数的兄弟模型(51%),训练成本不到 500 美元。
- 数据构建:从 SEC 10-K 财报构建 FinQA 数据集,经专家三层验证。
- 失败模式:前沿模型会幻觉表格 schema、用垃圾填满自己的上下文、反复重复失败策略——真正的瓶颈是工具使用的纪律性,而非推理深度。
- 训练方法:用简单的 pass/fail 二元奖励做 RL;结果技能迁移到更难的多表问题,且不损害通用工具使用能力。
- 反直觉结论:更简单的训练数据和更简单的奖励效果最好。
- 模型已开源(rLLM-FinQA-4B on Hugging Face),可视为企业级 agent 训练的蓝本。
「编程与Agent」频道最新
- 开发者观察:让 agent 修你不懂的 bug,就是现实版连续回形针最大化 — brandon_xyzw · 2026-10-10
- exe.dev 推出 ssh 即用开发沙盒,为开发者和 AI agent 提供云端 VM — davidcrawshaw · 2026-10-10
- Surge AI 发布 sudo L7 基准:60 个真实任务测编码 Agent 的资深工程师判断力 — rmcwhorter99 · 2026-10-10
- 作者上线实时直播:展示 AI 智能体搜寻新行星时使用的图像 — BLUECOW009 · 2026-10-10
- 同时跑 5 个 AI 编码会话,开发者只能来回切窗口问「进度如何?」 — tdhopper · 2026-10-10
- Cognition 演讲:91% 的 Devin 会话无需人类即可自主启动 — charles_irl · 2026-10-10