Eval Cards 项目与 everyevalever 推动评测数据库整合
davidmanheim · x · 2026-09-16
AI 评测圈的一次协作动向:davidmanheim 提到其团队的 Eval Cards 项目正在做比某评测排行榜站点更 extensive 的工作,希望与 @kmjablonka、@BartenOtto、@XRobservatory、@PauseAI 等评估相关方理清分工、避免重复劳动。
同时他牵线 @evaluatingevals 的 everyevalever 项目,希望把各方评测整合进同一数据库;对方也表示乐意配合。整体是评测标准化与数据整合的社区协作进展,信息偏碎片。
「研究」频道最新
- Cohere 发布 Tiny Aya L2-Thinker:3.35B 模型 60 种语言内推理率超 93% — Cohere_Labs · 2026-09-16
- 7 小时人手数据打败 17 小时公开数据集,机器人操作成功率 85% — YuXiang_IRVL · 2026-09-16
- AgentIR:把 agent 推理轨迹嵌入检索,让搜索引擎为 AI 而非人类服务 — CShorten30 · 2026-09-16
- AI Evals FAQ 更新至 48 问:新增敏感数据、大 trace、LLM 裁判等实操问答 — HamelHusain · 2026-09-16
- TurnTrout 提出碎片理论新解释:无害文档也能塑造出「聊蜜蜂」碎片 — dhadfieldmenell · 2026-09-16
- NVIDIA 在 Hugging Face 发布 6-DoF 姿态估计基础模型 FoundationPose — _akhaliq · 2026-09-16