语言学奥赛首次引入 AI 挑战赛,Opus 达金牌水平
Cohere_Labs · x · 2026-08-19
Cohere Labs 团队发布 IOL-AI Challenge 论文:基于 2026 年国际语言学奥林匹克(IOL)个人赛未公开题目举办开放竞赛,46 支队伍提交 731 份方案,在严格算力限制(单块 T4、30 分钟)下评测,并首次由 IOL 官方评审按人类选手同一评分标准打分。另测评 15 个不受限的前沿与开源模型,Claude Opus 4.8 获得相当于金牌的评审分。关键发现:能力不由规模决定,14B 模型击败两倍大小的对手,提升主要来自解码与输出处理而非模型容量;自动指标排序与评审完全一致,但会压缩分差,给弱系统虚高约 13 分。
「研究」频道最新
- Anthropic 发布 Claude 蛋白质结合剂数据集 — Anthropic · 2026-08-19
- 直观图解 GAN:生成器与判别器的对抗训练 — ProfTomYeh · 2026-08-19
- 浙江大学研究:看短视频时大脑控制网络会“休眠” — alex_verem · 2026-08-19
- 微软 Agent Lightning 用 6K 数据将 SWE-bench 提升至 56.4% — omarsar0 · 2026-08-19
- ReForce:引入力感知的机器人遥操作重定向方法 — chris_j_paxton · 2026-08-19
- GLM 路径误差低于 Grok,双模型机器人控制实测对比 — MaziyarPanahi · 2026-08-19