HalluHard 新成绩:GPT-6-Astra 幻觉控制大幅领先所有对手
maksym_andr · x · 2026-09-18
maksymandr 在幻觉评测 HalluHard 上公布新结果:GPT-6-Astra 显著优于包括 Fable 5 在内的所有其他模型,且开/关联网搜索均成立。作者指出现在很少有人讨论幻觉问题,但它仍是模型不确定性感知不足的重要指标。本条补充了不开联网搜索时的成绩链接。
所属事件:GPT-6-Astra 幻觉评测大幅领先,多轮幻觉仍是行业难题(3 条相关)→
「模型」频道最新
- 斯坦福 Marin 开放实验室直播训练 535B 模型,十人团队全程公开 — wandb · 2026-09-18
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- Pro 用户控诉 Codex 用量骤降:加倍付费仍撑不住一天工作 — Junra · 2026-09-18
- GPT-6 Astra 破译一封此前无人解开的 1918 年德军无线电报 — moultano · 2026-09-18
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 — SakanaAILabs · 2026-09-18
- Gemini 3.8 Live 架构拆解:原生音频 Sub-100ms 延迟与实时工具调用 — 4bTechDecode · 2026-09-18