幻觉率对比:Gemini 4 Argon 15%,远低于 GPT-6 Astra 51% 与 Opus 5.5 66%
brandon_galang · x · 2026-10-01
AA-Omniscience 幻觉率基准显示三家旗舰模型差距悬殊:Gemini 4 Argon 仅 15%,GPT-6 Astra 51%,Opus 5.5 高达 66%。Brandon Galang 评价:虽警惕 Gemini 的刷榜倾向,但这一表现足以让 Argon 成为企业聊天场景首选——对普通用户来说,模型说「我不知道」远好过编造答案,"知道何时闭嘴"才是终极基准。
「模型」频道最新
- NormViz 基准:最强模型跨16国文化规范理解仅得25.3% — StellaLisy · 2026-10-01
- 四家量化版本横评:69 题实测 Qwen3.8-27B 表现差异 — norenEnmotalen · 2026-10-01
- 爆料:OpenAI DevDay 新增 MCP events 支持,可订阅邮件免轮询 — banteg · 2026-10-01
- LangChain 发布 LangSmith 微调:agent 轨迹一键变训练数据 — LangChain · 2026-10-01
- 用户吐槽 GPT-5.6 Sol 大幅降智,换字体要试三次还得花三倍 token — Existing-Slide7395 · 2026-10-01
- 新旗舰模型未明显超越 GPT/Claude 还搞三档分批放号,Reddit 热议 — taiwbi · 2026-10-01