AI 基准测试自测引质疑,独立评估受关注

AI 基准测试的可靠性引发讨论。有观点用"学生自己在家考 SAT 并自己监考、报告分数"作类比,质疑让模型厂商自行运行基准测试的可信度。与此同时,a16z 政策团队与 Vals 创始人对谈,探讨政策制定者应如何理解 AI 基准测试,指出静态测试很快过时、需随模型进化,并强调独立评估的必要性。

2026-08-19 ~ 2026-08-19 · 2 条相关