MMLU 考 80 分已不稀奇,感叹大模型能力迅速贬值
andrew_n_carr · x · 2026-07-22
科技从业者 Andrew Carr 感叹 AI 行业发展之快:仅仅在一年半以前,大语言模型在 MMLU(大规模多任务语言理解)基准测试中突破 80 分还是引发行业震动的大事件;而如今,这已经成了稀松平常的日常。
这一观点引发了共鸣,直观反映出前沿 AI 模型能力基准线的快速攀升,以及大众对高性能大模型的心理阈值正在不断拔高。
「漫话AGI」频道最新
- Steven Pinker 说智能有边界,不是无限标量 — SydSteyerhart · 2026-07-27
- 一张海报设想 AI 走向合成智能与超越智能 — CurieuxExplorer · 2026-07-27
- AI智力超越人类必被察觉,Claude输出晦涩指令引吐槽 — zetalyrae · 2026-07-27
- AI 实验室员工对“明年能做到什么”明显沉默了 — ChrisGPT · 2026-07-27
- AI 可能通过科研垃圾内容侵蚀科学体系 — rbhar90 · 2026-07-27
- 组织本身或许就是地球上的超智能 — eldonredwards · 2026-07-27