校准实测续:最贵模型准确率和校准双双垫底
AlexKim · x · 2026-09-19
作者实测发现价格与发布时间都无法预测校准表现:kimi-k3 是所测最贵模型,却在准确率和校准上双双垫底;deepseek-v4-flash 以 0.003 美元跑完全部测试,准确率反而超过 Jev。他强调:价格和身价都不决定模型是否会「承认不确定」——有的模型就是不说自己没把握。
所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→
「模型」频道最新
- 网友用逻辑题测试 typesafeAI 分类器 Jev,一个怪招测出知识截止 — MrCyclopede · 2026-09-19
- RSI-Exam 排行榜更新:GPT-6-astra 以 0.5126 居首 — yuyinzhou_cs · 2026-09-19
- 用户吐槽 Claude Max 套餐:刚用四小时额度就耗尽 — yangyi · 2026-09-19
- Grok Bot 语音功能已在移动端全量推送 — Daniel_Farinax · 2026-09-19
- McGill-NLP 发布 AfriqueQwen 3.5 多语言模型,胜过 Gemma 3 — davlanade · 2026-09-19
- Karpathy 一年前狠批 AI Agent 是 slop,如今被翻出对照当下 — steipete · 2026-09-19