EvaluatingEvals 平台上线后数据量从 10 万条增至 50 万条
evijit · x · 2026-09-13
EvaluatingEvals 平台发布 beta 版时收录了 10 万条模型评测结果,目前数据量已增长至 50 万条。平台正在持续扩充收录的评测者(evaluators)名单,公开征集更多数据来源。
「研究」频道最新
- 两名高中生重度借助 AI 解出 Fields 得主 June Huh 未竟难题 — QuanquanGu · 2026-09-13
- 果蝇大脑连上模拟器,真的在玩 Chrome 恐龙跑酷 — Severe-Tangelo-7985 · 2026-09-13
- 从 KV 缓存本质讲透 MHA/MQA/GQA/MLA 四种注意力变体的区别 — techNmak · 2026-09-13
- 用SAE拆解LLM角色扮演:模型内部存在「沉浸模拟模式」特征 — sebkrier · 2026-09-13
- 果蝇全脑16.6万神经元图谱完成,数日内被接上Doom — GregCook2011 · 2026-09-13
- 测试时训练指南:模型在使用中持续学习的关键路径 — TheTuringPost · 2026-09-13