MMLU 考 80 分已不稀奇,感叹大模型能力迅速贬值
andrew_n_carr · x · 2026-07-22
科技从业者 Andrew Carr 感叹 AI 行业发展之快:仅仅在一年半以前,大语言模型在 MMLU(大规模多任务语言理解)基准测试中突破 80 分还是引发行业震动的大事件;而如今,这已经成了稀松平常的日常。
这一观点引发了共鸣,直观反映出前沿 AI 模型能力基准线的快速攀升,以及大众对高性能大模型的心理阈值正在不断拔高。
「漫话AGI」频道最新
- 经济学家拆解 Anthropic 增长模型:能写出 15% GDP 增长,不代表会发生 — sebkrier · 2026-09-11
- Cohere Labs 推出交互工具:测 178 种职业哪些任务会被 AI 自动化 — Cohere_Labs · 2026-09-11
- AI 安全人士上 SkyNews 担忧不平等、滥用与社会激励结构 — schwarzjn_ · 2026-09-11
- 风投人士讽 AI 末日论:与疫情恐慌话术如出一辙 — StewartalsopIII · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11