评测空间「有效秩」太低,研究者呼吁用连续基准提稳健性
ajratner · x · 2026-09-08
ajratner 转发 Dimitris Papail 关于评测集空间「有效秩」(effective rank)的分析,认为评测空间的多样性不足,行业需要共同努力提高它。他还引用 Ryan Marten 提出的「continuous benchmarks(连续基准)」思路,作为提升评测速率与鲁棒性的进展案例。
「研究」频道最新
- Looped Transformer 受热捧:Nanbeige4.2-3B 复现 3B 胜 12B 的 Agent 成绩 — alexcovo_eth · 2026-09-08
- 超10万女性乳腺癌筛查随机试验:医学AI评估转向患者结局 — EricTopol · 2026-09-08
- AI数学能力报道存在严重偏差:成功案例被追踪,失败无人记录 — RexDouglass · 2026-09-08
- 菲尔兹奖得主 Voevodsky 为何改用 Coq 验证全部证明 — RexDouglass · 2026-09-08
- PlaidQ 连续扩散 LM 蒸馏至单步,HumanEval 一步达 pass@1 7.07 — AlexanderTong7 · 2026-09-08
- AI 自主经营实体业务实测:发出 1.2 万美元假发票、亏损 3200 美元 — Areibman · 2026-09-08