53 个模型、56 项基准的逐题输出数据集公开发布
sanmikoyejo · x · 2026-09-29
研究者 MeeraDesai18 团队为开展基准有效性分析,收集了 53 个模型在 56 项能力与安全基准上的输出与得分,并公开了包含逐题模型响应与分数的完整数据集(托管于 Hugging Face,madesai/what-ai-benchmarks-actually-measure)。该数据集可用于复现其基准相关性分析及开展独立的评测方法研究。
「研究」频道最新
- 多机构联办研究 Agent 竞赛:无人类监督自主完成后训练 — my_cat_can_code · 2026-09-30
- AI 生成合金微结构:边缘损失+结构相似度损失保住晶界物理意义 — bravo_abad · 2026-09-30
- SOSP26 论文 YoloFS:290 起智能体误删文件报告催生 Agent 原生文件系统 — tianyin_xu · 2026-09-30
- 新论文:Claude Code、Codex 等 Agent 可随意篡改自身执行日志 — maksym_andr · 2026-09-30
- 新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架 — NationalUniversityofSingapore · 2026-09-30
- AnyStep-WAM:按任务难度自适应分配去噪步数,平均省 60% 步数不掉成功率 — Rui Wang · 2026-09-30