GPT-5.6 Sol ARC-AGI 提升 25%,推理 Token 降 6 倍
OpenAIDevs · x · 2026-08-17
GPT-5.6 Sol 在 ARC-AGI-3 基准测试中,通过 retained reasoning 和 compaction 技术,准确率从 13.3% 提升至 38.3%,同时输出 Token 消耗减少约 6 倍。此外,房产初创公司 Hypha AI 使用 GPT-5.6 Luna 进行文档提取,在保持 GPT-5.5 98% 准确率的同时,成本降至 1/18;金融研究工具 Rogo AI 则通过程序化工具调用,在匹配评估质量的前提下减少了 21% 的输入 Token。
所属事件:OpenAI 披露 GPT-5.6 降本增效表现(3 条相关)→
「模型」频道最新
- Grok 4.6 编码实测:搞定复杂逻辑但系统性遗漏基础 — mark_k · 2026-08-18
- Qwen3.8-27B 基准测试与 DeepSeek V4、GPT-5.6 Luna Max 并驾齐驱 — anderspitman · 2026-08-18
- Orion 16B 突破 1000 亿训练 Token,利用 DPP 分布式算力 — markjeffrey · 2026-08-18
- RareBench 实测:Gemini 3.7 Flash 大跃升,DeepSeek Pro 未见提升 — danielmckinn0n · 2026-08-18
- DeepSeek V4-Pro 正式全量上线:可调推理强度并新增 Responses API — thione · 2026-08-18
- xAI 发布 Grok 4.6:主打长时 Agent 任务,基准追平 GPT-5.6 Sol — thione · 2026-08-18