Primer 夺冠金融基准测试,揭示评测集本身存在错误
rohanpaul_ai · x · 2026-08-06
Primer 团队发布了详细的技术博客,分享其 AI 金融助手在 BigFinanceBench 基准上的测试细节。Primer 以 79.1% 的准确率击败了所有通用大模型(最佳成绩为 56%)。
除了证明 Agent 架构的优越性外,团队在人工核查测试题时发现,该基准公开的 50 道题中有约 12% 存在参考答案错误或数据缺陷。这意味着当前的模型评测分数可能部分反映了系统对错误参考答案的迎合程度,而非真实的金融分析能力。
所属事件:金融AI实测:智能体架构比底层模型更关键(3 条相关)→
「编程与Agent」频道最新
- Sakana AI发布Marlin:可自主思考8小时的虚拟CSO — SakanaAILabs · 2026-08-06
- 学者激辩 AI 智能体架构:神经模块才是编排工具调用的核心 — PMinervini · 2026-08-06
- tldraw 发布 SDK 5.3:画布支持人类与 AI 智能体协同评论 — max__drake · 2026-08-06
- Vercel CEO 分享内部 Agent 实践:每家公司都该有一个 — brandon_galang · 2026-08-06
- uv 0.11.25 引入局部依赖覆盖,避免全局冲突 — KhuyenTran16 · 2026-08-06
- Google 发布 8 月 AI 更新:推 90 个复用 Agent 技能与托管基础设施 — rseroter · 2026-08-06