隐身模型 Ox Alpha 登场 Context Arena,匹配 GPT-5.6
scaling01 · x · 2026-08-24
Context Arena 新增隐身测试模型“Ox Alpha”。该模型在 12.8 万词高思维模式下取得了 75.3% 的 AUC 分数,表现与 Gemini 3.1 Pro、GPT-5.6 Luna 等顶尖模型持平,并超越 Claude Sonnet 5。测试发现,开启最大思维反而会降低 3.2 万词以上长度的准确率,且消耗增加约 34%。模型在 51.2 万词长度下仍保持 39.0% 的得分。
「模型」频道最新
- OpenAI谷歌掀大模型降价潮,智谱神秘模型碾压Claude — 创业邦 · 2026-08-24
- 神秘OxAlpha碾压Claude,阿里800亿港元押注AI — 创业邦 · 2026-08-24
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24
- Fable 5 仅占 6% 销量,Anthropic 遭遇降本冲击 — rohanpaul_ai · 2026-08-24
- Opus 5 说话像法庭剧?如何调教掉废话 — thk_ · 2026-08-24
- 2026 年中国模型全景:DeepSeek V4、Kimi K3 等在列 — TheTuringPost · 2026-08-24