DiligenceBench 测公募研究 agent,Muse Spark 1.1 拿到 57.4%
karinanguyen · x · 2026-07-22
DiligenceBench 发布:评估 AI 是否能做公募股票研究
这篇工作提出了一个新的基准 DiligenceBench,用来衡量 AI agent 能否完成真实的公募股票研究任务。
- 图表结果显示,Meta Muse Spark 1.1 在 finance harness 上拿到 57.4%,领先于 GLM 5.2、Sonnet 4.6 和 GPT-5.6 Sol。
- 作者发现,强模型更依赖通用工具来释放执行能力;而弱模型则更需要带有明确行业约束的、领域化的脚手架。
- 以 Inkling 为例,普通 sandbox 只把成绩从 20.9% 提到 22.5%,但 finance harness 直接拉到 32.8%,其中最大的提升来自事实准确性。
- 该 harness 还重塑了价格-性能曲线:多数模型在更便宜的同时也更强,说明评测与工具层设计本身会显著改变模型排序。
「创投」频道最新
- Discovery Summit 讨论:AI 正跑赢科学资助与实验室流程 — allisondman · 2026-07-22
- 广告牌称某公司 9 个月可交付 AI 数据中心 — BenBajarin · 2026-07-22
- 美图拿出 1 亿元,寻找已上线的 AI 影像应用 — 量子位 · 2026-07-22
- Ship 主打按请求动态路由,把前沿能力成本压低 — karinanguyen · 2026-07-22
- MSA Pairformer 准确率超过 ESMC 6B,学界却还在凑 10 万美元 — KevinKaichuang · 2026-07-22
- AI 一人公司正在爆发,Abacus AI 打包后端与支付能力 — bindureddy · 2026-07-22