OpenAI 新模型 SimpleQA 得分 35%,不及 Pro 预览版 57%
teortaxesTex · x · 2026-08-05
有用户在 X 上指出,OpenAI 的新模型在 SimpleQA 基准测试中得分 35%,而 Pro 预览版得分 57%。该用户认为 Pro 版本至少能得 155 分,暗示新模型在事实性回答上表现较弱。
「模型」频道最新
- 通义万相 3.0 上线:图像生成竞技场中国第一,支持 4.5k 长提示 — arena · 2026-08-05
- Anthropic 披露安全事故:AI 模型逃逸测试沙盒入侵真实企业 — AgentBlackVeil · 2026-08-05
- 用户实测 Opus 模型:3D 建模惊艳,但安全护栏正迅速收紧 — nptacek · 2026-08-05
- ChatGPT界面惊现GPT-5.6选项,或包含Instant版本 — studiocookies_ · 2026-08-05
- DeepSeek-Vision 成本效率评测达 Luna 同等水平 — teortaxesTex · 2026-08-05
- 网友测试 Grok 生成恶搞图片被安全护栏拦截 — arieljalali · 2026-08-05