大模型再现新莫拉维克悖论:擅长解数学难题却搞不定日常指令
近期多位业界观察者与开发者指出,当前大模型正展现出一种荒谬的能力错位:它们能解决复杂的开放性数学难题,却在修改账单、遵循简单指令等日常任务中频频翻车,甚至白白消耗上千万Token与数百美元。这种反差揭示了模型在抽象推理与处理现实繁杂规则之间存在巨大鸿沟,引发了对AI实际落地能力的反思。
已确认
- 能力错位现象:@YuchenjUW、@shakoistsLog 与 @rickasaurus 指出,AI Agent 在处理高数难题甚至黎曼猜想时表现极佳,但在执行修改客户发票、处理报税或遵循3个简单指令时却频频出错,甚至消耗海量资源。安全专家 halvarflake 也调侃大模型花几千美元算力能解决菲尔兹奖级别的数学猜想,却搞不定日常代码 Bug。
- 商业落地困难:@paraschopra 提出了大模型时代的「新莫拉维克悖论」,指出对 LLM 而言,证明复杂的数学猜想反而比开发一款能在 App Store 赚 100 美元的简单应用要容易得多。
- 长程任务易跑题:@NYCounihan 反映,模型在连续编写5个小时代码时缺乏专注力,容易偏离主线并生成无用的“AI 垃圾”支线任务。
为什么重要
- 新版莫拉维克悖论:@ajratner 认为,这本质上是新版莫拉维克悖论的再现,即人类觉得极难的数学和编程对AI反而容易,而人类觉得简单的日常任务对AI却极难。他提醒,不应基于数学编程领域的突破去线性外推AI在其他缺乏可验证数据领域的表现。
- 缺乏主动发问能力:@Franc0Fernand0 分析指出,AI与人类实习生的核心差距不在于纯粹智力,而在于遇到不合常理或矛盾情况时,人类会主动停下来发问,目前的AI却做不到这一点,这是导致其在现实业务中频频出错的关键原因。
2026-08-02 ~ 2026-08-03 · 8 条相关
一手来源
- AI的讽刺:能解开放数学题,却搞不定三个简单指令 — Yuchenj_UW ·
- AI再现莫拉维克悖论:数学编程猛进,人类常识依然难解 — ajratner ·
- AI能解数学难题却听不懂指令?核心差距在于「不懂发问」 — Franc0Fernand0 ·
- AI Agent能搞定高数却改不对账单 — shakoistsLog · 2026-08-02
- AI 能解决黎曼猜想,却做不好我的 taxes — rickasaurus · 2026-08-02
- 【源头】AI的讽刺:能解开放数学题,却搞不定三个简单指令 — Yuchenj_UW · 2026-08-03
- 能解千禧难题却修不了Bug?研究员调侃AI能力反差 — mboehme_ · 2026-08-03
- 【源头】AI再现莫拉维克悖论:数学编程猛进,人类常识依然难解 — ajratner · 2026-08-03
- 【源头】AI能解数学难题却听不懂指令?核心差距在于「不懂发问」 — Franc0Fernand0 · 2026-08-03
- 能解数学题却写不好代码?用户吐槽 AI 编程爱跑题 — NYCounihan · 2026-08-03
- 新莫拉维克悖论:LLM 擅长解数学题却难做赚钱 App — paraschopra · 2026-08-03