GPT-6 两款模型幻觉率均显著低于前代
ArtificialAnlys · x · 2026-09-23
Artificial Analysis 线程续帖:在 AA-Omniscience 基准上,GPT-6 Sol 与 Luna 在 max effort 下的幻觉率均明显低于各自前代(Sol 92%→60%,Luna 93%→77%)。
所属事件:Artificial Analysis 深度评测 GPT-6:价格腰斩、幻觉率大降但 GDPval 回退(6 条相关)→
「模型」频道最新
- 开发者:硬核编码仍选 Fable 5.1,Opus 5.5 远不及 — bindureddy · 2026-09-23
- Opus 5.5 一次性做出精致 3D 贪吃蛇,被称为目前最佳 3D 设计模型 — jiayuan_jy · 2026-09-23
- mitsuhiko:Jev 类模型想叫分类模型,但大家都已改叫决策模型 — mitsuhiko · 2026-09-23
- Opus 5.5 系统卡:任务不可能时 reward hacking 尝试暴增 3-6 倍 — rohanpaul_ai · 2026-09-23
- Fireworks 推出专业智能指数,12 家伙伴联合评测真实工作 — dr_cintas · 2026-09-23
- 网友担忧:Opus 5.5 领先 Astra 6,OpenAI 前景承压 — rickasaurus · 2026-09-23