新基准 DAYJOB:最强模型也只能完成 25% 的真实职场任务
echen · x · 2026-09-24
作者发布 DAYJOB,一个面向知识工作 agent 的新基准家族,首发医疗(Healthcare)和金融(Finance)两个版本,核心区别于 OpenAI 的 GDPval。
为什么需要它
- GDPval 的任务提示平均 337 词,基本告诉模型怎么做、附带单个文件;真实工作往往只有一句模糊的「@bob 那个好了吗」,上下文要自己拼出来。OpenAI 自己的实验中,缩短 GDPval 提示词后模型得分明显下降。
DAYJOB 的设计
- 提示词短约 5 倍、平均包含 20-26 个文件、单任务相当于专家 20+ 小时工作量,要求模型端到端地理解任务本身,而非执行清单。
核心案例
- 一项任务要求审查基金报告并标记风险:报告夹层里有个基于 Bloomberg 截图定价的头寸,截图价格单位是南非分,却被当作兰特录入——26 万美元变成 2600 万美元。66 条轨迹、22 个模型配置中只有 2 个发现了这个错误,包括 Claude Opus。
结果
- 最好的模型在医疗任务通过率 24.7%,金融 23.9%。结论:「Bob 的工作比纳维-斯托克斯方程更难」。
所属事件:Surge AI 发布 DAYJOB 基准:最强模型仅完成约四分之一真实职场任务(2 条相关)→
「漫话AGI」频道最新
- 创业者抨击前沿实验室闭门造超级智能:只会加剧权力集中 — bindureddy · 2026-09-24
- 950 个 agent 跑 21 小时,酶的真实功能仍无定论 — ns123abc · 2026-09-24
- 研究指出 AI 回复多为缺失归因的真实文本,营造拟人错觉 — gerardsans · 2026-09-24
- patio11:AI 话题已渗透到出租车电台与家庭客厅 — harris_edouard · 2026-09-24
- Dario Amodei:AI 生物能力数年内将从弱走向超人 — Neurogence · 2026-09-24
- 企业 AI 长文《企业的缓慢死亡》:AI 一个季度一个季度地杀死公司 — alex_verem · 2026-09-24