MMLU 考 80 分已不稀奇,感叹大模型能力迅速贬值

andrew_n_carr · x · 2026-07-22

科技从业者 Andrew Carr 感叹 AI 行业发展之快:仅仅在一年半以前,大语言模型在 MMLU(大规模多任务语言理解)基准测试中突破 80 分还是引发行业震动的大事件;而如今,这已经成了稀松平常的日常。

这一观点引发了共鸣,直观反映出前沿 AI 模型能力基准线的快速攀升,以及大众对高性能大模型的心理阈值正在不断拔高。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →