隐身模型 Ox Alpha 登场 Context Arena,匹配 GPT-5.6

scaling01 · x · 2026-08-24

Context Arena 新增隐身测试模型“Ox Alpha”。该模型在 12.8 万词高思维模式下取得了 75.3% 的 AUC 分数,表现与 Gemini 3.1 Pro、GPT-5.6 Luna 等顶尖模型持平,并超越 Claude Sonnet 5。测试发现,开启最大思维反而会降低 3.2 万词以上长度的准确率,且消耗增加约 34%。模型在 51.2 万词长度下仍保持 39.0% 的得分。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →