ATLAS 金融评测:11 个前沿模型最佳仅 12 分,人类 100 分碾压
garrytan · x · 2026-09-16
Handshake 联合创始人 Garrett Lord 介绍 ATLAS Finance 基准:给 11 个前沿模型 100 道专家级金融任务,每道人类需 15–30 小时完成,智能体需在数据室、邮件、聊天、日历、文档、Excel 等环境中穿梭,并应对数十个引入模糊性与实时变化的同事/客户角色。
结果:人类完成度 100%,最佳 AI 仅 12%。结论是 AI 距离满足投行、咨询、PE 最初级从业者的标准还很远——正如华尔街名言「95% 正确等于 100% 错误」,软件之外的自主知识工作仍远未达标。
「漫话AGI」频道最新
- 「一万智能体」其实是 1 个模型跑 1 万线程,多样性不如一万人 — danbri · 2026-09-16
- LeCun 回应 AI 末日论:一剂「现实主义疫苗」 — RichmanRonald · 2026-09-16
- 观点:AI 不会终结人类可能性,只会暴露我们探索得太少 — umesh_ai · 2026-09-16
- 新论文:发明者在创意空间中的定位与经济增长的含义 — danielrock · 2026-09-16
- OpenAI 员工 roon:实验室藏不住突破,一两个月内人人都有同等能力 — Tolopono · 2026-09-16
- Schmidhuber 回应「LLM 无法创新」论:只因没实现他的趣味理论 — SchmidhuberAI · 2026-09-16