Ethan Mollick:现有 AI 评测分数普遍被测试框架拖后腿

emollick · x · 2026-08-07

知名学者 Ethan Mollick 指出,当前几乎所有表现优异的 AI 大模型评测分数背后,其实都隐藏着一个前提:如果使用更好的测试框架,这些分数可能会显著提高。 这反映了当前基准测试设计可能严重低估了模型的真实能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →