新翻译模型评测频漏掉最强者,引业界共鸣
bclavie · x · 2026-09-11
作者 bclavie 表示,每当看到新的翻译模型发布却不与业界公认最强者(GOAT)对比评测时,就能体会当初 xeophon 看到各评测普遍漏掉 Qwen 时的无奈。帖子折射出模型评测常选择性忽略头部模型的现象。
「模型」频道最新
- 传 OpenAI 临近验证 Hodge 猜想,一个月内或连破千禧难题 — ctjlewis · 2026-09-11
- 256k 上下文用到 80% 和 1M 用到 80% 效果一样吗 — BriefServe453 · 2026-09-11
- Pro 用户连续 4 天 90% 时间无法用 Codex,客服只有机器人 — Effective-System-727 · 2026-09-11
- DeepSeek 发布 V4.1-Flash:百万 token 上下文,KV 缓存缩小 4 倍 — matlabulous · 2026-09-11
- 研究者澄清:Gemini 3.1 Pro 智能体实验在封闭模拟中进行 — QuintinPope5 · 2026-09-11
- 用户吐槽:OpenAI 200 美元档体验两周内已缩水回 100 美元水平 — AIandDesign · 2026-09-11