六款模型当幻觉检查员横评:GPT-6 Sol 查出 470 项,远超 Grok 的 219 项
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 在 20 个任务的固定子集、8 个模型的交付物上对比了六款幻觉检查器,最终选定 GPT-6 Sol (high) 用于生产环境。
- 测试对象包括 GPT-6 Sol、GPT-6 Luna、Grok 4.7、Claude Opus 5.5、Claude Sonnet 5.5、Gemini 3.8 Flash
- GPT-6 Sol 和 GPT-6 Luna 查出的实质性幻觉最多,Claude Sonnet 5.5 和 Gemini 3.8 Flash 少得多
- 各模型行中 Opus 的判定始终介于 Grok 4.7 与 Sonnet 5.5 之间
- 总计:GPT-6 Sol 确认 470 项实质性幻觉,Grok 219 项,Opus 99 项,Sonnet 57 项——且这是在保守标记策略下的结果
所属事件:幻觉门控改写法律基准排名,Grok 4.7 登顶(8 条相关)→
「模型」频道最新
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09
- Anthropic 使用条款被批「空泛到没有意义」:随时可封禁用户 — ivan_bezdomny · 2026-10-09
- 用户吐槽 codex 表现“如 GPT-3.5”:知识库更新后不重审结论 — Yamapama · 2026-10-09
- 置信度校准胜过准确率:Nimble 9B 自动化路由量达基座 2.7 倍 — AgitatedUsual8995 · 2026-10-09
- Perplexity 开源决策模型 pplx-decider 可跑在笔记本上 — ycombinator · 2026-10-09