Ramp 发布会计智能体基准:最强模型三次尝试仅 21% 正确率

willcb · x · 2026-09-18

Ramp 与会计专业人士合作推出 Accounting Bench,包含 137 个任务与评分细则,全部基于真实日常会计工作流构建。

结果显示:即使允许三次尝试,表现最好的模型正确率也只有 21%。可靠的可智能体化会计工作仍然是一个开放挑战。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →