Epoch 审计 15 个 AI 基准:仅 4 个可放心采信
Jsevillamol · x · 2026-09-18
Epoch AI 推出 Benchmark Reviews 计划,对 AI 评测基准进行系统性审计,首批覆盖 15 个基准。审计结论:仅 4 个被标记为 Verified(可放心采信),9 个存在缺陷(Flawed),另有 2 个因信息不足暂无法评审。该计划旨在解决「不知道该信哪些基准分数」的行业痛点,为模型评测提供可信度参考。
所属事件:Epoch AI 启动基准审计:15 个评测仅 4 个通过验证(9 条相关)→
「模型」频道最新
- Qwen3.8-Omni-Flash 性能与定价页公开 — Alibaba_Qwen · 2026-09-18
- 阿里发布 Qwen3.8-Omni-Flash:首个面向 Agent 的全模态模型 — Alibaba_Qwen · 2026-09-18
- Bonsai 量化模型 128k 上下文跑出 50 tok/s,24GB 卡可双开 — julianharris · 2026-09-18
- encoder粉丝气到用encoder搞生成,decoder早就在做分类了 — HanchungLee · 2026-09-18
- Sakana 发布 Fugu Max:动态路由多模型编排,免费开放使用 — tkasasagi · 2026-09-18
- 有人预测:未来所有 LLM 都会原生内置「jev 模式」 — multimodalart · 2026-09-18