语言学奥赛首次引入 AI 挑战赛,Opus 达金牌水平

Cohere_Labs · x · 2026-08-19

Cohere Labs 团队发布 IOL-AI Challenge 论文:基于 2026 年国际语言学奥林匹克(IOL)个人赛未公开题目举办开放竞赛,46 支队伍提交 731 份方案,在严格算力限制(单块 T4、30 分钟)下评测,并首次由 IOL 官方评审按人类选手同一评分标准打分。另测评 15 个不受限的前沿与开源模型,Claude Opus 4.8 获得相当于金牌的评审分。关键发现:能力不由规模决定,14B 模型击败两倍大小的对手,提升主要来自解码与输出处理而非模型容量;自动指标排序与评审完全一致,但会压缩分差,给弱系统虚高约 13 分。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →