Open Source Model Scores Higher Than API? Flawed Evaluator Penalizes Extra Fields

VikParuchuri · x · 2026-08-15

VikParuchuri discovered that an evaluator penalizes extra fields in output without stripping metadata/confidence fields first, causing API scores to be underestimated (65% vs 77% for open source).

Related event: LlamaIndex benchmark scoring flaw uncovered; Datalab jumps to 93.6% after fix(6 posts)→

Original post →

More from Research

Research channel →