Bridgewater 实测:微调开源 Qwen3-235B 错误率优于前沿模型
anacondainc · x · 2026-09-02
Anaconda 博客复盘桥水基金 AIA Labs 与 Thinking Machines Lab 合作的案例,说明「人人可下载同一模型」时差异化来自数据与专家流程。
关键数据:
- 六项面向宏观投资者的信息分拣任务上,仅给任务描述时前沿模型准确率不足 50%
- 专家撰写细致任务说明并重构问题后,最佳前沿模型提升至 78.2%,自动 prompt 优化无进一步收益,仍未达 80% 信任门槛
- 改用开源 Qwen3-235B:开箱仅 44.8%,但用自有专家标注数据微调后达 84.7%,错误比最佳前沿模型少约 30%,单任务推理成本约仅 1/14
- 教训:第一版用非专家供应商标注效果很差,可信标注流程才是护城河;选 Qwen 正因其微调行为文献记录充分
「公司和人」频道最新
- AI 政策学者 Matthew Clifford 加入 Anthropic,常驻伦敦对接各国政府 — SamuelAlbanie · 2026-09-02
- Anthropic 重启校园大使计划:三个方向各补贴 3600 美元 — claudeai · 2026-09-02
- Gemini 科学能力负责人跳槽 Anthropic,转攻科学发现前沿 — alewkowycz · 2026-09-02
- The Information 记者回应 Astra 报道争议:细节比标题更复杂 — steph_palazzolo · 2026-09-02
- Ashley Kramer 加盟 ElevenLabs 出任首席营收官 — lukeharries · 2026-09-02
- The House Fund 创始人:伯克利不缺成果,缺的是讲故事的本能 — jfiance · 2026-09-02