Mollick 批评万亿产业的质量评测仍靠粗糙测试,更好方法已有

emollick · x · 2026-09-08

Ethan Mollick 表态:这不是为 OpenAI 的糟糕跑分辩护,而是持续吐槽一个万亿美元级产业——其产品质量的主要公开评级来自最受信任的评测方,而采用的却是这类粗糙测试,尽管明显更好的测试方法论是可行的。

观点直指行业痛点:AI 能力的公共评估体系严重落后于已有测量科学水平,评测榜单的可信度因此存疑。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →