斯坦福建模模拟 AI 评测生态探讨基准私有化影响

斯坦福团队发布 70 页论文《The AI Evaluation Ecosystem》(arXiv:2610.09296),构建生成式 agent 模拟系统,研究评测如何在充满反馈回路的模型生态中塑造厂商与用户行为。核心反事实问题是:若所有 benchmark 全部私有会怎样?结果显示私有 holdout 基准多数情况下能拉近评测结果与用户满意度,为 benchmark 设计提供了新视角。

2026-10-11 ~ 2026-10-11 · 2 条相关