开源模型得分反超API?评估器未剥离元数据导致分数虚低

VikParuchuri · x · 2026-08-15

VikParuchuri发现某评估器在计算完美提取分数时,未先剥离输出中的元数据/置信度字段,导致API得分被低估(65% vs 开源模型77%)。

所属事件:LlamaIndex基准评分有缺陷,修复后得分升至93.6%(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →