如何信任 AI 研发评测?关键看打分者有没有亲手标过数据
dfrsrchtwts · x · 2026-09-23
作者提出一个「全盘考虑后的」观点:只有当 AI 研发类评测(evals)由亲手做过大量模型输出人工打分、并认真思考过如何把这种经验转化为评测的人来制作和评分时,他才信任这些评测。
同时他指出,游戏类 bot 任务并不属于人们通常所说的「AI R&D evals」,即评测任务的设计应区分能力域,不能一概而论。
「研究」频道最新
- 蓝噪声采样:不降温度也能减少 mode collapse、生成更稳 — amplifiedamp · 2026-09-23
- 论文:RRSI,给智能体递归自我改进加上正则化 — HuaxiuYaoML · 2026-09-23
- 自训光流扩散模型:用帧间流场扭曲生成图实现视频连续性 — pixlpa · 2026-09-23
- Kimi K3 的 KDA 与 Qwen3.8 GDN 对比:逐通道门控让 2D 旋转成为可能 — orvieto_antonio · 2026-09-23
- PrimeScientist 用 MCTS 分配研究预算:奖励多 10.3% 实验少一半 — dair_ai · 2026-09-23
- 开发者复盘 3D 编码 harness:模型变强后脚手架几乎失效 — rms80 · 2026-09-23