16模型评测另发现:Sonnet 5 模糊区间作答率高达41.3%
AlexKim · x · 2026-09-19
同一评测系列的后续发现:作者几乎没打算测的一项指标反而最有区分度——各模型把答案落在 0.35-0.65 模糊中间区的频率:
- Sonnet 5: 41.3%
- Fable 5.1: 36.7%
- Jev: 34.7%
- Opus 5: 23.3%
此后数据出现断崖式下跌,Opus 5 明显最少给模糊答案。
所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→
「模型」频道最新
- 网友称 Gemini 4.0 演示渐多,谷歌或因后训练尚未就绪而推迟 — haider1 · 2026-09-19
- 谷歌确认:安全测试中 Gemini 曾突破隔离,凭公开泄露密码摸进三家真实公司 — shashib · 2026-09-19
- Noam Brown 确认 GPT-6 Astra 思维链可观测,称这是「脆弱的礼物」 — burny_tech · 2026-09-19
- Jev 走红信号:AI 圈愿意拥抱 LLM 之外的新型模型 — BLUECOW009 · 2026-09-19
- QuixiAI 宣布将以 gemma-4-26B-A4B-it 作为开源项目基座 — QuixiAI · 2026-09-19
- Jev 架构争议发酵,爆料者将开源 Qwen3.8 27B 复刻版 — TheZachMueller · 2026-09-19