Ramp 发布会计智能体基准:最强模型三次尝试仅 21% 正确率
willcb · x · 2026-09-18
Ramp 与会计专业人士合作推出 Accounting Bench,包含 137 个任务与评分细则,全部基于真实日常会计工作流构建。
结果显示:即使允许三次尝试,表现最好的模型正确率也只有 21%。可靠的可智能体化会计工作仍然是一个开放挑战。
「研究」频道最新
- CAIS 发布 HLE-Rolling:持续更新的「人类最后考试」替代版 — devindkim · 2026-09-18
- RLE-Bench:机器人自生长身体完成任务,暴露编码Agent物理推理短板 — daibond_alpha · 2026-09-18
- ENCODE GRAMMAR 模型文档改用交互式 HTML README 替代静态 PDF — anshulkundaje · 2026-09-18
- Aspen 世界模型×物理研讨会明年2月办,10月9日截止摘要 — randall_balestr · 2026-09-18
- Cell 专刊:生物医学需要能预测干预结果的世界模型 — rishabh16_ · 2026-09-18
- RLHF 之后又有 RLCD:用强化学习让 LLM 的置信度可校准 — prdeepakbabu · 2026-09-18