Grok 4.5 在 15 万张真实账单测试中拿到最高准确率
elonmusk · x · 2026-07-25
Grok 4.5 被 Elon Musk 形容为“很适合真实工作”,并被 Ramp 的一项实测拿来对比 15 万张真实企业账单。
- Ramp 用实际业务发票测试模型,评分标准是:模型是否能预测人类会做出的每一处修正。
- 结果里,Grok 拿到最高的完全抽取率,超过了同价位的 Gemini Flash 3.6、GPT 5.6 Terra 和 Sonnet 5。
- 这是一项很吃长上下文推理的任务:模型要从 10 万+ token 的历史发票、业务记忆和人工修正里总结规律,再应用到新账单上。
- 目标是实现 zero-click accounts payable,让发票处理无需人工介入即可自动正确完成。
「模型」频道最新
- 前沿实验室爆料称 Opus 5 的 ARC-AGI 3 分数像假的 — flowersslop · 2026-07-25
- 图表称 Claude Opus 5 对防御编码拦截更少 — repligate · 2026-07-25
- Claude Opus 5 上线,DirectTerminal 给 Claude Code 补上终端增强输出 — draginol · 2026-07-25
- Codex 重置日历显示:额度并不总在 UTC 午夜刷新 — petrusenko_max · 2026-07-25
- Databricks 称 Claude Opus 5 登顶内部编程基准并上线 AI Gateway — thesaraharminta · 2026-07-25
- Opus 5 评价和 Opus 3 聊时事:适合“day one”阅读 — repligate · 2026-07-25