会计任务大考:58%难题无模型能解,Claude居首

EdwardSun0909 · x · 2026-08-01

Mercor 发布了针对会计任务的 AI 智能体基准测试 APEX-Accounting。测试包含 10 个商业环境和 160 个月末结账任务,要求 AI 跨应用推理并处理不完整记录。

结果显示,当前前沿模型仍无法可靠完成专业会计工作:58% 的任务在任何模型的 8 次尝试中均未通过。表现最好的 Anthropic Fable 5 也仅满足了 56.4% 的评分标准,Meta Muse Spark 1.1 (52.6%) 和 OpenAI GPT-5.6 (51.5%) 紧随其后。此外,模型偶尔能解出难题,但几乎无法在多次尝试中保持一致性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →