Primer 夺冠金融基准测试,揭示评测集本身存在错误

rohanpaul_ai · x · 2026-08-06

Primer 团队发布了详细的技术博客,分享其 AI 金融助手在 BigFinanceBench 基准上的测试细节。Primer 以 79.1% 的准确率击败了所有通用大模型(最佳成绩为 56%)。

除了证明 Agent 架构的优越性外,团队在人工核查测试题时发现,该基准公开的 50 道题中有约 12% 存在参考答案错误或数据缺陷。这意味着当前的模型评测分数可能部分反映了系统对错误参考答案的迎合程度,而非真实的金融分析能力。

所属事件:金融AI实测:智能体架构比底层模型更关键(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →