本地 8B 模型在 ML 摘要里编造了 7.2% 的数字
Former_Appointment84 · reddit · 2026-07-23
一位 Reddit 用户测试了本地 8B 模型在撰写 ML pipeline 输出摘要时,会不会胡编数字,结果测到 7.2% 的数字伪造率。
他搭了一个校验器,把模型生成文本里的每个数字都和由 XGBoost → SHAP → optimizer 管线形成的真值池比对;在 30 个种子下,Llama 3.1 8B Instruct Q4KM 一共写出 138 个数字,其中 10 个无法在源数据里找到对应,控制组的前沿 API 模型则是 537 个数字、0 个伪造。
更值得注意的不是轻微算错,而是凭空编造结构:比如不存在于管线中的 ROI 表、预算拆分,甚至在模板里留下 $X 占位符却同时造出一个指标。作者也明确说明这只是单一模型、单一量化和单一提示链的结果,尚不能判断到底是量化损伤还是 8B 参数规模本身的上限。
「研究」频道最新
- NeurIPS 审稿结果开始陆续发放 — timrudner · 2026-07-23
- 每月衍生模型占比已明显向中国倾斜 — natolambert · 2026-07-23
- 每日开放模型看板显示:中国仍明显领先美国 — natolambert · 2026-07-23
- 教学 notebook 从零搭建神经网络,靠线代和链式法则讲清训练 — GeostatsGuy · 2026-07-23
- DeepSeek-V4-Pro 在 Ascend 910C 训练中暴露长尾算子瓶颈 — teortaxesTex · 2026-07-23
- 作者把 agent 记忆改成陈述图后,身份冲突和旧事实失效问题明显缓解 — chrislally · 2026-07-23