Cohere 发起多语言模型人类评测,招募贡献者
Cohere_Labs · x · 2026-08-01
Cohere 宣布其实验室发起的多文化谜语基准(multicultural riddle benchmark)项目已进入人类评估阶段,目前已完成超过 6.1 万次模型回复评估。
项目正在招募母语者参与后续评估,特别需要阿拉伯语(摩洛哥和苏丹方言)等语言的贡献者。参与者除了进行人类评估,还有机会参与基准测试、结果分析,甚至作为共同作者署名最终发表的论文。
所属事件:Cohere多文化谜题基准进入人类评估阶段(2 条相关)→
「研究」频道最新
- EMNLP 2026 收录:CWoMP 濒危语言形态标注方法 — fredahshi · 2026-08-24
- SemiAnalysis 开源 300 万美元 AgentX 基准,百万上下文测 AI 编程 — AccBalanced · 2026-08-24
- Vinci2 助手在 EgoServe 基准超 GPT-5-mini,实现主动干预 — jiqizhixin · 2026-08-24
- OpenAI 招聘变革性 AI 经济学主管,MATS 奖学金开放申请 — Astral Codex Ten · 2026-08-24
- AI 科学家有了新标尺:从“考试”转向真实发现闭环 — 量子位 · 2026-08-24
- AI 协助证明埃尔德什猜想超越性 — inductionheads · 2026-08-24