ATLAS 金融评测:11 个前沿模型最佳仅 12 分,人类 100 分碾压

garrytan · x · 2026-09-16

Handshake 联合创始人 Garrett Lord 介绍 ATLAS Finance 基准:给 11 个前沿模型 100 道专家级金融任务,每道人类需 15–30 小时完成,智能体需在数据室、邮件、聊天、日历、文档、Excel 等环境中穿梭,并应对数十个引入模糊性与实时变化的同事/客户角色。

结果:人类完成度 100%,最佳 AI 仅 12%。结论是 AI 距离满足投行、咨询、PE 最初级从业者的标准还很远——正如华尔街名言「95% 正确等于 100% 错误」,软件之外的自主知识工作仍远未达标。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →