同题横评:Ministral 14B 与 Qwen3.8-27B 表格查询全对,Gemma 4 幻觉翻车
andrejusb · x · 2026-09-05
作者用同一张保险透视表、同一条带 "" 的查询、不给 schema 的条件测试三个模型:
- Ministral 14B(Standard 模式):完全答对
- Gemma 4 31B(Advanced 模式):产生幻觉、把真实值置空、列错位
- Qwen3.8-27B(换入 Advanced 模式):同样完全答对
作者附上了实测视频、GitHub 仓库和在线演示链接。结论:模型尺寸和"高级模式"并不保证表格数据查询的可靠性,31B 的 Gemma 反而输给两个更小的模型。
「模型」频道最新
- 传 OpenAI 工程师称 GPT-6 Astra 让内部项目提前半年 — Polymarket · 2026-09-05
- 实测称开源模型已逼近前沿模型,实验室涨价疑为上市铺垫 — Fluffy-Ad-889 · 2026-09-05
- Sam Altman 感叹 Astra 几分钟就能做出他随手想象的小游戏 — sama · 2026-09-05
- 用户吐槽 GPT-6 各端可用性混乱:Chat 有 Pro 版,Codex 却没有 — justalexoki · 2026-09-05
- 网友让 Astra 生成同时满足时空对称性的动画 — yaroslavvb · 2026-09-05
- 3D 艺术家实测 GPT-6:一个 prompt 组装整车并做动画 — petewoodbridge · 2026-09-05