32个本地模型实测:F1分数掩盖的幻觉陷阱

KitchenAmoeba4438 · reddit · 2026-08-06

作者使用 1001 条笔记对 32 个本地大模型进行了事实抽取任务的基准测试,重点考察模型在“无事实可提取”时的表现。

核心发现

作者建议,在评估信息抽取模型时,除了 F1 分数,必须将“弃权率”和“幻觉计数”纳入考量,并在测试集中包含正确答案为空(沉默)的样本。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →