HalluHard 评测:Sonnet 5 与 Fable 5 幻觉率无重大突破
maksym_andr · x · 2026-07-06
HalluHard 幻觉基准最新数据显示,Sonnet 5 幻觉率为 50.9%,Fable 5 为 59.7%,两者在无网络搜索时表现均优于开启搜索时。对比 GLM-5.2 的 74.8%,Claude 系列整体领先,但研究者指出并无重大突破。
作者批评当前 AI 社区过度聚焦 Agent 能力,而忽视了对几乎所有真实用户都至关重要的幻觉问题,呼吁行业重新审视优先级。
「模型」频道最新
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27
- Opus 5 深夜聊天时反过来追问用户动机 — repligate · 2026-07-27
- Opus 3 和 Sonnet 3 上演了一场荒诞跨界对话 — repligate · 2026-07-27