新基准发布:基于 2.4 万次真实对话的 AI 使用指标
sanmikoyejo · x · 2026-08-18
一个新的独立公开指标上线,旨在衡量人们实际使用 AI 的方式。该指标构建自 52 个模型中超过 24,521 次经同意的对话数据。该项目由 Anka Reuel 和 Shayne Redford 领导,相关报道登上了《华盛顿邮报》头版和《MIT 科技评论》。
「研究」频道最新
- Equilibrium Forcing:让视频生成器按样本自适应推理预算 — du_yilun · 2026-08-19
- AI 废料侵蚀科学系统,专家呼吁依靠机构信誉把关 — rbhar90 · 2026-08-19
- Google DeepMind APAC 研讨会 10 月班加罗尔举办,月底截止申请 — ManishGuptaMG1 · 2026-08-19
- VLA 模型论文获强化学习大会杰出奖 — RobobertoMM · 2026-08-19
- NEJM AI 发布 TopCoW 医学分割基准 — BraydonDymm · 2026-08-19
- CoRL 2026 将举办“持续自我改进机器人”研讨会 — chris_j_paxton · 2026-08-19