开源模型得分反超API?评估器未剥离元数据导致分数虚低
VikParuchuri · x · 2026-08-15
VikParuchuri发现某评估器在计算完美提取分数时,未先剥离输出中的元数据/置信度字段,导致API得分被低估(65% vs 开源模型77%)。
所属事件:LlamaIndex基准评分有缺陷,修复后得分升至93.6%(6 条相关)→
「研究」频道最新
- GitHub 项目利用 AI 批量生产 0day 漏洞逼厂商修复 — evilsocket · 2026-08-15
- 动态短卷积:改进 Transformer 表达能力的新方法 — Cohere · 2026-08-15
- 论文:用机器学习工具连接海马体理论与神经计算 — AndrewLampinen · 2026-08-15
- TEMPO 作者释疑:递归自我批评+宏步价值估计生成密集信号 — teortaxesTex · 2026-08-15
- 微软提出 RadFusion,实现可调节阈值的放射科报告生成 — erichorvitz · 2026-08-15
- 新论文提出“潜在阅读”:用机器学习解读《芬尼根的守灵夜》 — begusgasper · 2026-08-15