Grok 4.5 在 15 万张真实账单测试中拿到最高准确率
elonmusk · x · 2026-07-25
Grok 4.5 被 Elon Musk 形容为“很适合真实工作”,并被 Ramp 的一项实测拿来对比 15 万张真实企业账单。
- Ramp 用实际业务发票测试模型,评分标准是:模型是否能预测人类会做出的每一处修正。
- 结果里,Grok 拿到最高的完全抽取率,超过了同价位的 Gemini Flash 3.6、GPT 5.6 Terra 和 Sonnet 5。
- 这是一项很吃长上下文推理的任务:模型要从 10 万+ token 的历史发票、业务记忆和人工修正里总结规律,再应用到新账单上。
- 目标是实现 zero-click accounts payable,让发票处理无需人工介入即可自动正确完成。
「模型」频道最新
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11