K2 Horizon 宁拒答不乱猜,幻觉率降至 26%
ArtificialAnlys · x · 2026-09-03
Artificial Analysis 指出 K2 Horizon 375B A23B 只尝试 40% 的 AA-Omniscience 问题,其余选择拒答而非乱猜,幻觉率 26%,为已测最低之一;准确率 18% 与前代持平,但较 K2 Think V2 的 71% 幻觉率大幅改善,AA-Omniscience 指数从 -40 升至 -3。
所属事件:K2 Horizon 评测细节公布:幻觉率仅 26%,agent 任务领先(4 条相关)→
「模型」频道最新
- 传 GPT-6 Astra 主打持久记忆,agent 或实现持续学习 — VraserX · 2026-09-04
- 网友放话:普通人只要用一次 GPT-5.6 Sol Pro 就不会再吐槽 — mallow610 · 2026-09-04
- 博主称某模型 5.5 升 5.6 提升显著,更期待下一版 A6TRA — mallow610 · 2026-09-04
- 网传 OpenAI 今天下午 1 点将官宣三款新模型 — saln1 · 2026-09-04
- 用户称赞模型 Sol:能力扎实还肯尝试,反驳不居高临下 — dreamwieber · 2026-09-04
- 传 OpenAI 新模型「Astra」即 GPT-6,发布当日全线服务宕机 — RachelVT42 · 2026-09-04