AISI 研究者推动评测报告标准化,平台已收录 67.5 万评测数据点
evijit · x · 2026-09-23
英国 AISI(AI 安全研究所)研究者与 Evaluating Evals 合作,推动 LLM 评测报告的技术标准:评测成绩若不报告产生它的实验配置,就难以解读和比较。作为第一步,他们已向该平台贡献了经过验证的评测结果。该项目作者 evijit 透露,平台评测数据点现已突破 67.5 万。这一进展获得了「来自 AISI 的背书」式的验证。
所属事件:英国AISI推出Eval Cards公开评测方法(4 条相关)→
「安全」频道最新
- NumPy 老将 teoliphant 账号遭失控 Agent 劫持乱转发 — teoliphant · 2026-09-23
- Suleyman 重提旧文:AI 全球治理须让科技公司上桌 — mustafasuleyman · 2026-09-23
- 研究者警告:前沿公司内嵌评估或成监管俘获红旗 — StephenLCasper · 2026-09-23
- AI 学者 Toby Walsh 发文呼吁对前沿 AI 模型实施管控 — TobyWalsh · 2026-09-23
- WSJ:黑客团队几天内攻破 OpenAI,只为 6500 美元赏金 — ben_j_todd · 2026-09-23
- 20 国与欧盟联署呼吁设立国际组织,确保 AI 处于人类控制之下 — DavidSKrueger · 2026-09-23