Solar Pro 4 幻觉率下降真相:靠拒答而非知识增长
ArtificialAnlys · x · 2026-08-13
评测数据显示,Solar Pro 4 的 AA-Omniscience 分数从 -53 提升至 -1,幻觉率也从 88% 大幅降至 24%。
然而,这种提升主要归功于模型选择了拒答,而非真正掌握了知识。Solar Pro 4 仅尝试回答了 41% 的问题(前代为 92%),其实际的 AA-Omniscience 准确率几乎未变,仅为 19%。
「模型」频道最新
- Grok 4.6 智能指数达 61,追平 GPT-5.6 跻身第一梯队 — aman_madaan · 2026-08-13
- OpenAI 实时语音模型轮次检测近乎完美,攻克语音交互顽疾 — pbbakkum · 2026-08-13
- 特斯拉工程师实测:Grok 4.6 成日常主力,图像处理极佳 — aman_madaan · 2026-08-13
- xAI 发布 Grok 4.6,首发登陆 Cursor 与 API — aman_madaan · 2026-08-13
- xAI 高管暗示 Grok 4.5 将至:主打编码智能体 — aman_madaan · 2026-08-13
- 网友猜测:Grok 4.6 是 Kimi K3 的微调版? — robertpro01 · 2026-08-13