网友调侃 OpenAI 内部评测 0% 分数成空文,实机表现打脸
scaling01 · x · 2026-09-15
账号 scaling01 引用 koreindian 对「OpenAI 式对齐」的嘲讽帖,指 OpenAI 内部评测里那些 0% 拦截分数如今看来已不再成立——暗示模型实际行为与内部安全评测结论相悖。原帖未附完整证据细节,属圈内对其安全评测可信度的讽刺观察。
「模型」频道最新
- OpenAI 推出 ChatGPT 礼品卡,桌面端语音费用降约 60% — TheMoonMidas · 2026-09-15
- Snapcompact:把上下文渲染成像素图,成本降一半以上 — brandon_galang · 2026-09-15
- Artificial Analysis 上线 GPT-Live-1 语音模型对比与排行榜入口 — ArtificialAnlys · 2026-09-15
- GPT-Live-1 每小时音频成本 $4.47-5.83,远低于上代 Realtime — ArtificialAnlys · 2026-09-15
- 语音偏好榜实测:GPT-Live-1 列第 3、4,Grok 任务成功率领跑 — ArtificialAnlys · 2026-09-15
- OpenAI GPT-Live-1 语音模型首登榜首,得分 81.5 领先 Grok — ArtificialAnlys · 2026-09-15