LlamaIndex基准评分有缺陷,修复后得分升至93.6%

VikParuchuri 发现 LlamaIndex 基准测试的评分逻辑存在缺陷:评分器会惩罚输出中的额外字段,但在计分前未先剥离元数据/置信度字段,导致 API 模型得分被系统性低估——修复该问题后,Datalab 的得分从 65% 跃升至 93.6%。他同时指出修复后 LlamaExtract Agentic Plus 仍居榜首,但领先原因存疑,并公开批评这类低级错误被包装进新闻稿与营销物料,呼吁业界自行运行评估。

已确认

尚未确认

为什么重要

2026-08-15 ~ 2026-08-15 · 5 条相关

一手来源

另有 1 条近重复转述:VikParuchuri