ARC-AGI 评测争议:Claude Opus 被指因 API 实现问题获高分
steipete · x · 2026-07-30
开发者 @steipete 指出,近期 Claude Opus 在 ARC-AGI 评测中的高分可能存在水分。其原因是该模型的 Chat Completion API 实现存在缺陷,错误地保留了推理 token,而官方并不支持该 API。不过,也有网友认为,如果 Opus 和 GPT-5 都使用了相同的通用测试框架,这种横向对比依然有效,说明 Opus 的泛化能力更好。
所属事件:Claude Opus的ARC-AGI高分被指受API实现影响(2 条相关)→
「模型」频道最新
- 腾讯混元 Hy3 模型解决 50 年未解组合数学难题 — Tim_Dettmers · 2026-07-30
- 微软MAI-Code-1-Flash实测:兼顾编程质量与Token效率 — lee_stott · 2026-07-30
- Sarvam AI 发布印度本土基础设施上的开源模型 — AashaySachdeva · 2026-07-30
- 实测 OpenRouter 全线 TTS:Kokoro-82M 长文本最佳且最便宜 — nathanborror · 2026-07-30
- Qwen3.6 MoE 2-bit 量化版登顶 Hugging Face 趋势榜 — EschaLabs · 2026-07-30
- 泄露任务揭示 Anthropic 训练机制:用人类轨迹训练裁判模型 — burny_tech · 2026-07-30