FinFIRST 基准细节:123 个专家任务、701 条原子标准、1.23 万评分点
FellMentKE · x · 2026-09-04
作者补充 FinFIRST 金融搜索 Agent 基准的细节:该基准由蚂蚁集团联合中金公司投行团队专业支持打造,V1 版本包含 123 个专家撰写的任务、701 条原子评判标准和 12300 个评分细则点(rubric points),专门面向真实场景下的金融搜索 Agent 评测。作者强调发布主张与评测框架回答的是不同问题:前者给人可适配的模型,后者给研究者和建设者一套更细致的方法,去检验 Agent 在哪里成功、失败或需要更近距离审查。
所属事件:蚂蚁联合中金开源金融搜索智能体基准 FinFIRST(2 条相关)→
「模型」频道最新
- GPT-6 Astra 发布,OpenAI 总裁暗示或达 AGI 水平 — steph_palazzolo · 2026-09-04
- ChatGPT 桌面端改版:Ultra 默认隐藏,需手动在设置中开启 — koltregaskes · 2026-09-04
- Meta Muse Spark 1.3 登 agentic 榜第二,成本仅榜首约三分之一 — ryanshrout · 2026-09-04
- Zvi 开启 Mythos+Fable 5.1 实测反应串:最强 AI 能打几分? — TheZvi · 2026-09-04
- Kimi 免费额度被自动化任务烧光,用户纠结买哪档订阅 — Inevitable_Fold_9081 · 2026-09-04
- Meta Muse Spark 1.3 误差少 38%,单任务成本 $0.85 压 Claude 与 GPT — ryanshrout · 2026-09-04