OpenAI Codex + GPT-5.6 Sol 在验证测试中达到 99% 召回
soumitrashukla9 · x · 2026-07-22
Project APE 的第一个核心结果是自动验证性能出现了明显跃升。
- 仅在六个月前,最好的验证器还低于 80%,意味着会漏掉五分之一的真实错误。
- 作者称在 2026 年 7 月,系统首次达到 99% 检测召回率。
- 这一结果对应的模型是 OpenAI 的 Codex + GPT-5.6 Sol。
- 几天后,Kimi K3 也达到了 98%。
「模型」频道最新
- 实测 Gemini 3.5 Flash-Lite:文档提取比 Claude 便宜 71 倍 — rseroter · 2026-07-23
- Sentdex 质疑 Kimi K3 对比 Nemotron 3 Ultra 的图表 — Daniel_Farinax · 2026-07-23
- 按显存档位整理的模型榜单:从 4GB 到 384GB — victormustar · 2026-07-23
- BTL-3 发布 27B 开源智能体编程模型,HumanEval 达 95.12% — soteko · 2026-07-23
- 测试丘吉尔风格骂人提示词,Claude 与 GPT 展现文风差异 — emollick · 2026-07-23
- NVIDIA 总结 Kaggle 挑战赛:开源模型推理优化实践 — NVIDIAAI · 2026-07-23