AA 评测:Gemini 4 Argon 瞎猜率仅 15%,为次优模型一半
zacharynado · x · 2026-10-06
- Artificial Analysis 的 AA-Omniscience 基准(10月5日当周)显示,Gemini 4 Argon 在不知道答案时胡编的概率约 15%,仅为次优前沿模型的一半。
- 排在其后的是 Qwen3.8 Max(29%)、Grok 4.7(29%)、Muse Spark 1.3(32%);GPT-6 Astra 准确率六款最高(61%),但答错时仍有 45% 是硬猜而非承认不知道。
- 作者指出:错答与不答哪个代价更高取决于任务场景,可按任务把请求路由给合适的模型。
「模型」频道最新
- Daniel Han 盘点当前值得信赖的 LLM 基准 — danielhanchen · 2026-10-06
- UPenn NLP 论文:声明验证基准主要测检索,推理能力被高估 — deliprao · 2026-10-06
- COLM26 研究:LLM 验证声明靠捷径,并非真正核对证据 — deliprao · 2026-10-06
- 同等智能下该看单任务成本:Opus 多花 94% token 反而便宜 23% — ChrisGPT · 2026-10-06
- 发文者称 GPT-6 Astra 首个达到世界级天体物理水平的 AI — johnseach · 2026-10-06
- $500 订阅在雅加达是巨款,区域 PPP 定价引热议 — sujingshen · 2026-10-06