LlamaIndex 实测 GPT-6 Astra:文档抽取 97.2% 创 SOTA,但长文仅 31.7%
llama_index · x · 2026-09-06
LlamaIndex 创始人 Jerry Liu 发布 GPT-6 Astra 在硬核文档解析与抽取任务上的基准测试结果:
- 短文档 one-shot 抽取 97.2%,在其 ExtractBench 上创下新 SOTA;中等文档 90.6%
- 长文档表现差:one-shot 仅 31.7%,长文档一次抽取本质上是难题
- 价格贵:平均每页 11 美分,约为其低成本文档抽取方案的 10 倍
- 原生 OCR 并不突出:与 Fable 5.1、gpt-5.6-sol 等前沿模型相比优势有限;表格理解很强,但图表、版面和语义格式化处理不佳
完整结果见 ExtractBench。结论:Astra 适合短中等文档的高精度抽取,长文档与成本敏感场景需另择方案。
「模型」频道最新
- 第三方实测称 Astra 基准表现仍差,笑点只有一个 — gleech · 2026-09-06
- LLM 棋艺不行?让 Astra 现场写个引擎对战中级棋力机器人 — MikePFrank · 2026-09-06
- Astra 电脑操作实测翻车:拖拽编辑器建页失败,但仍是进步 — BLUECOW009 · 2026-09-06
- Astra 在 harness 构建任务上令人失望,不敌 Fable 5.1 — HarveenChadha · 2026-09-06
- GPT-6 Astra 在自家 CPU 上跑 DOOM 达 20+ FPS,前代仅 1 FPS — Angaisb_ · 2026-09-06
- 用户用 GPT-6 Astra 自主调研飞机制造并搭出可运行 3D 工厂仿真 — deanwball · 2026-09-06