Cohere 用发布后才出的 WMT26 基准测试翻译模型,规避训练数据泄漏
cohere · x · 2026-10-04
Cohere 在 North Small Translate 系列帖(5/6)中说明其基准测试方法:采用 WMT26 基准——这套测试集是在模型完成之后才发布的,从时间上杜绝了「针对评测指标训练」的可能。
这是对开源模型常见的 benchmark 污染质疑的正面回应,强调评测结果的可信度。
所属事件:Cohere 开源翻译模型 North Small Translate(3 条相关)→
「模型」频道最新
- RL 环境本质是数据:未饱和时推进前沿,饱和后失效 — Shahules786 · 2026-10-04
- GLM 驱动国际象棋机器人 AI 逆转绝杀人类对手 — MikePFrank · 2026-10-04
- 网友称 mythos 5 是最有魅力的语言模型之一 — repligate · 2026-10-04
- Apodex 1.1 Mini 上线 Novita AI,免费试用延长至 14 天 — SimonShaoleiDu · 2026-10-04
- Cloudflare 在 HF 发布视觉模型 clef,作者喊话 Perplexity 接入 — ostrisai · 2026-10-04
- Reddit 用户实测:Codex 一周耗尽额度,Claude 仅用 2% — Peleias · 2026-10-04