32个本地模型实测:F1分数掩盖的幻觉陷阱
KitchenAmoeba4438 · reddit · 2026-08-06
作者使用 1001 条笔记对 32 个本地大模型进行了事实抽取任务的基准测试,重点考察模型在“无事实可提取”时的表现。
核心发现
- F1分数的欺骗性:gemma-4-31B 和 gemma-4-12B 的 F1 分数几乎相同,但在面对无事实笔记时,31B 模型保持沉默的概率仅为 46% 并捏造了 180 条假信息,而 12B 模型沉默率高达 70%,仅捏造 97 条假信息。
- 克制优于召回:如果下游管道有审核机制,应选择召回率高的模型(如 31B);如果直接写入知识图谱且不再复查,应选择更懂得“闭嘴”的模型(如 granite-4.1-3b,沉默率 93%,幻觉极少)。
- 解析率不代表准确性:LFM2.5-230M 虽然拥有 100% 的完美解析率,但得分仅为 0.1309,说明它能流利地输出错误答案。
作者建议,在评估信息抽取模型时,除了 F1 分数,必须将“弃权率”和“幻觉计数”纳入考量,并在测试集中包含正确答案为空(沉默)的样本。
「模型」频道最新
- AI天气模拟:风场更准确,湿度云层待优化 — anselm · 2026-08-07
- 只要无模型全能,AI 路由就能击败所有单一模型 — Muennighoff · 2026-08-07
- 谷歌展示 Gemma 离线翻译机:基于树莓派 5 打造 — GlennCameronjr · 2026-08-07
- DeepSeek 就 API 涨价争议致歉并提供退款 — teortaxesTex · 2026-08-07
- Meta AI 挑战五项 STEM 奥赛,物理理论获满分并夺数学金牌 — AIatMeta · 2026-08-06
- 用24GB内存运行193B参数模型:8个专家模型动态路由实现 — Similar_Wealth_1850 · 2026-08-06