HalluHard 评测:GPT-6-Astra 幻觉表现显著领先 Fable 5
maksym_andr · x · 2026-09-18
maksymandr 公布幻觉评测 HalluHard 的新结果:GPT-6-Astra 在开与不开联网搜索的情况下,都显著优于包括 Fable 5 在内的所有其他模型。作者指出当前讨论幻觉的人不多,但幻觉仍是衡量模型不确定性感知缺失的重要指标。
所属事件:GPT-6-Astra 幻觉评测大幅领先,多轮幻觉仍是行业难题(3 条相关)→
「模型」频道最新
- 斯坦福 Marin 开放实验室直播训练 535B 模型,十人团队全程公开 — wandb · 2026-09-18
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- Pro 用户控诉 Codex 用量骤降:加倍付费仍撑不住一天工作 — Junra · 2026-09-18
- GPT-6 Astra 破译一封此前无人解开的 1918 年德军无线电报 — moultano · 2026-09-18
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 — SakanaAILabs · 2026-09-18
- Gemini 3.8 Live 架构拆解:原生音频 Sub-100ms 延迟与实时工具调用 — 4bTechDecode · 2026-09-18