AA-Omniscience评测:Sol与V4知识量领先,但均严重幻觉
teortaxesTex · x · 2026-07-21
有推友基于AA-Omniscience测试分享了几个有趣的现象:
- Sol的知识水平接近Fable,明确领先于K3和V4。
- V4和K3的表现非常接近。
- Grok 1.5T表现优异。
- V4是一个“胡说八道机器”,而Sol同样如此。
这引发了关于模型规模扩大对幻觉和知识获取影响的讨论。
所属事件:AA-Omniscience 图表对比 28 款大模型准确率与幻觉率(2 条相关)→
「模型」频道最新
- 开源模型 Hy3 闯入前端代码竞技场总榜第 16 名 — arena · 2026-07-22
- DeepSWE评测:Kimi K3达到Claude Fable 5同等能力,成本仅35% — togethercompute · 2026-07-22
- 实测对比:Gemini 3.5 Flash在轻量编程任务中优于GPT-5.6 — Shick_hydro · 2026-07-22
- NVIDIA 称 Nemotron 3 Ultra 在 2026 IMO 上拿到 30/42 — NVIDIAAI · 2026-07-22
- Gemma-4-26B-a4B 传在微调对比中压过 Qwen MoE — JLeonsarmiento · 2026-07-22
- OpenAI 传将向美国政界简报下一代模型家族 — kimmonismus · 2026-07-22