Ox Alpha 实测遇尴尬:551 次 API 调用才完成 87 题
anshulkundaje · x · 2026-08-23
@sbatzoglou 通过 OpenRouter 实测了 Ox Alpha 在 induction 基准(ICML 2026 spotlight 论文《INDUCTION: Finite-Structure Concept Synthesis in First-Order Logic》)上的表现:
- 成绩中等:排在 Luna 和 DeepSeek v4 Pro 之下,略高于 Gemini 3.7 Flash。作者强调 X 上其他基准里 Ox Alpha 表现很强,结果可能高度依赖基准类型。
- 稳定性存疑:模型频繁返回空字符串或 API 报错,共打了 551 次 API 调用才拿到 87/100 的完成率。作者不确定是 OpenRouter 的问题,还是推理模型解不出题时不返回答案的通病在此更加明显。
基准数据与评估代码开源在 GitHub 仓库 concept-synth 中(arXiv:2602.18843)。
「模型」频道最新
- 模型刷榜导致交互能力退化,遇歧义不反问 — Fowe · 2026-08-23
- 烧 117 亿token评测:DeepSeek V4 登顶网络安全基准 — sull · 2026-08-23
- 曝 OpenAI 拟推 Mona Lisa 与 Luna Lisa 图像模型 — mark_k · 2026-08-23
- 多模态 LLM 读取地图闹笑话,将地名认错 — GaryMarcus · 2026-08-23
- Fable 用合成推理轨迹突破任务瓶颈,GLM 5.3 效仿 — mariofilhoml · 2026-08-23
- OpenAI 指南称 GPT-5.6 配合新 API 摧毁 Agent 经济 — dl_weekly · 2026-08-23