DiligenceBench 测公募研究 agent,Muse Spark 1.1 拿到 57.4%
karinanguyen · x · 2026-07-22
DiligenceBench 发布:评估 AI 是否能做公募股票研究
这篇工作提出了一个新的基准 DiligenceBench,用来衡量 AI agent 能否完成真实的公募股票研究任务。
- 图表结果显示,Meta Muse Spark 1.1 在 finance harness 上拿到 57.4%,领先于 GLM 5.2、Sonnet 4.6 和 GPT-5.6 Sol。
- 作者发现,强模型更依赖通用工具来释放执行能力;而弱模型则更需要带有明确行业约束的、领域化的脚手架。
- 以 Inkling 为例,普通 sandbox 只把成绩从 20.9% 提到 22.5%,但 finance harness 直接拉到 32.8%,其中最大的提升来自事实准确性。
- 该 harness 还重塑了价格-性能曲线:多数模型在更便宜的同时也更强,说明评测与工具层设计本身会显著改变模型排序。
「创投」频道最新
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- Marc Lou 免费发布复盘小书:36 个创业项目赚 300 万美元 — marclou · 2026-09-11
- 卡车经纪公司被收购,估值核心竟是 AI 平台与运力网络 — MatthewChang · 2026-09-11
- 投资人放话:Palantir×英伟达联手将重创 Anthropic IPO 估值 — pdamodaran · 2026-09-11
- Kimi K3 发布后 Moonshot 年化营收从 3 亿美元两月冲至 10 亿 — Hesamation · 2026-09-11
- SEO 老手:中端市场公司做 AI SEO 卡点在执行运营而非策略 — gaganghotra_ · 2026-09-11