Gemini 4 Argon 幻觉率 15%,居 AA-Omniscience 榜首
import_jmr · x · 2026-10-02
Artificial Analysis 的 AA-Omniscience 基准显示,Gemini 4 Argon 以 15% 的幻觉率在领先模型中最低,远低于 Grok 4.7(29%)、GPT-6 Astra(45%)和 Opus 5.5(59%)。作者指出这一指标意义不止于错误数量:智能还包括元认知——模型对自身知识可靠性的判断。当模型的置信度与准确率同步时,不确定性就成为检索、追问或弃答的有效信号;幻觉率低的模型更「知道自己的知识边界在哪」,这正是自主性的基础。
所属事件:Gemini 4 Argon 幻觉率 15% 领跑 AA-Omniscience 榜单(2 条相关)→
「模型」频道最新
- AstaBrief 实测:比 Claude 驱动模式快 3.5 倍,引用质量相当 — allen_ai · 2026-10-02
- AI2 开源 AstaBrief 8B:研究问题一键生成带引用报告 — allen_ai · 2026-10-02
- 开源 2B 嵌入模型 topk-embed-v1-small 跑进 Perplexity 私有评测前沿 — antoine_chaffin · 2026-10-02
- GPT-6.1 Sol 最高档连跑 20 小时,额度才用掉 15% — MatthewBerman · 2026-10-02
- 微软发布新 AI 模型,宣称实时转写准确率全球第一 — luisdans · 2026-10-02
- DeepMind 员工实测内部模型 Argon:从此不再首选 Opus — natanielruizg · 2026-10-02