Mollick 批评万亿产业的质量评测仍靠粗糙测试,更好方法已有
emollick · x · 2026-09-08
Ethan Mollick 表态:这不是为 OpenAI 的糟糕跑分辩护,而是持续吐槽一个万亿美元级产业——其产品质量的主要公开评级来自最受信任的评测方,而采用的却是这类粗糙测试,尽管明显更好的测试方法论是可行的。
观点直指行业痛点:AI 能力的公共评估体系严重落后于已有测量科学水平,评测榜单的可信度因此存疑。
「模型」频道最新
- 斯坦福学者批评前沿 AI 公司把数学界当跑分对象,呼吁尊重学界 — RishiBommasani · 2026-09-08
- 网友称 Fable 5.1 发布后 Opus 水平已跌至 30B 级 — ccerrato147 · 2026-09-08
- 同一提示词横评:Gemini 3.8 Flash 对比 GPT-6 Astra 表现差异 — iamfakhrealam · 2026-09-08
- 月付 $400 的 Claude 20x Max 约等于 $16,000 API 用量 — tedddyoweh · 2026-09-08
- AA 指数更新:Fable 5.1 与 GPT-astra 得分持平 — jietang · 2026-09-08
- 视频剪辑师实测 GPT-6 Astra:几分钟自动重建 Premiere 完整剪辑工程 — _AustinCalvert_ · 2026-09-08