曝 Gemini 4 Argon 幻觉率仅 15%,远低于 GPT-6 系列的 51%-54%
eyishazyer · x · 2026-10-01
有网友对比称,最被低估的 Gemini 4 Argon 指标不是智能而是「诚实度」:幻觉率仅 15%,远低于 GPT-6 Astra 的 51% 和 GPT-6.1 Sol 的 54%。其整体准确率较低(50% vs 63%),但不知道时会更坦率承认而非硬编。注意:帖子提到的模型型号与数据未经官方证实,请谨慎看待。
「模型」频道最新
- Gemini 4 Argon 在 AA Coding Agent Index 编码测试表现亮眼 — prateeky2806 · 2026-10-01
- Anthropic 评估:GLM-5.3 可自主构建 Chrome 漏洞利用,防护近乎为零 — matthew_d_green · 2026-10-01
- Artificial Analysis 公布 Solar Mini 4 完整智能指数测试结果 — ArtificialAnlys · 2026-10-01
- Upstage 发布 Solar Mini 4:3B 激活参数拿下 Intelligence Index 24 分 — ArtificialAnlys · 2026-10-01
- 红队测试 GLM 5.3 发现诡异输出,怀疑 OpenRouter 路由到 1bit 量化版 — voooooogel · 2026-10-01
- 谷歌员工自曝 Gemini 4 擅长长上下文:摄取与长序列生成都强 — RubenEVillegas · 2026-10-01