Cohere多文化谜题评测进入人工评估阶段
Cohere_Labs · x · 2026-08-01
Cohere Labs 宣布其多文化谜题(multicultural riddle)基准项目已进入人类评估阶段,目前已评估超过 61,000 个模型回复。
该项目旨在打造 NLP 领域最具多语言和多文化代表性的人类评估数据集。团队正在积极招募更多母语人士和文化专家参与,特别急需阿拉伯语(摩洛哥、苏丹、埃及)、卢干达语、斯瓦希里语和西班牙语(秘鲁)等语言的使用者。
所属事件:Cohere多文化谜题基准进入人类评估阶段(2 条相关)→
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24