完成标准和不出幻觉是两种能力:Kimi K3 通过率 93% 但每任务 2.09 次幻觉
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 指出,满足评测标准与不产生幻觉是两种不同的能力:Kimi K3 (max) 的标准通过率高达 93.0%,但平均每任务出现 2.09 次实质性幻觉;Muse Spark 1.3 (max) 通过率 96.0%,平均每任务 1.68 次幻觉。
所属事件:幻觉门控改写法律基准排名,Grok 4.7 登顶(8 条相关)→
「模型」频道最新
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09
- Anthropic 使用条款被批「空泛到没有意义」:随时可封禁用户 — ivan_bezdomny · 2026-10-09
- 用户吐槽 codex 表现“如 GPT-3.5”:知识库更新后不重审结论 — Yamapama · 2026-10-09
- 置信度校准胜过准确率:Nimble 9B 自动化路由量达基座 2.7 倍 — AgitatedUsual8995 · 2026-10-09
- Perplexity 开源决策模型 pplx-decider 可跑在笔记本上 — ycombinator · 2026-10-09