实测反直觉:参数翻倍的 Gemma 31B 提取数据反逊 Ministral 14B
andrejusb · x · 2026-08-11
一篇关于文档数据提取的实测对比得出了反直觉的结论:在处理同一张保险数据透视表且不提供 Schema 的情况下,参数量翻倍的模型表现反而更差。
- Gemma 31B(Advanced 模式):准确度较低,出现了严重的幻觉,不仅抹除了真实数值,还将数据整体错位移到了相邻的列。
- Ministral 14B(Standard 模式):精准完成了提取任务。
结论:模型参数量大并不等同于更适合你的具体业务,在实际工作流中应当对不同量级的模型进行针对性测试。
「模型」频道最新
- Perplexity Agent API 上线 Kimi K3,附自动化数据报告实践 — AravSrinivas · 2026-08-11
- 仅改 PDF 文件名就能刷高分?研究揭示 LLM 评测易受暗示 — generativist · 2026-08-11
- DeepSeek 开源 OCR 2 模型:引入视觉因果流,精准转 Markdown — tom_doerr · 2026-08-11
- 预测 Anthropic 将拆分对话与智能体模型 — natanielruizg · 2026-08-11
- DeepSeek v4 flash 越狱提示词曝光,角色扮演可破除安全护栏 — aaditya_ai · 2026-08-11
- 获批 Anthropic 安全计划仍遭拒答,开发者吐槽转投开源 — npinto · 2026-08-11