500 美元 RL 训练 4B 模型,金融问答反超 235B 大模型

AI Engineer · youtube · 2026-10-10

Snorkel AI 研究科学家 Charles Dickens 在 AI Engineer 大会分享:Snorkel 与 UC Berkeley Sky Computing Lab 用开源 rLLM 框架和强化学习,训练了一个 Qwen3 4B 模型,在真实金融问答上以约 60% 准确率击败了 235B 参数的兄弟模型(51%),训练成本不到 500 美元。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →