LlamaExtract Agentic Plus仍居榜首,但评测可能过拟合或存在错误

VikParuchuri · x · 2026-08-15

VikParuchuri 指出 LlamaExtract Agentic Plus 在基准测试中仍领先,但可能原因包括:擅长该文档类型、基准过拟合(厂商常在自己基准上领先)、或评分存在重大错误。此前他提到开源模型 lift 得分高于 API(77% vs 65%),暗示评分可能有问题。

所属事件:LlamaIndex基准评分有缺陷,修复后得分升至93.6%(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →