仅凭 3 个计数示例,gpt-3.5-turbo 也能答对 99% 的 strawberry 题
ctjlewis · x · 2026-09-28
作者 ctjlewis 介绍其论文的核心观点:思维本质上是可计算的。今天 LLM 用自然语言做"推理",与他论文的做法在结构上是同构的,只是载体从符号变成了概念。
论文的关键实验是:只需在 prompt 里加入约 3 个"逐字母计数"的示例,就能让 gpt-3.5-turbo 在经典的 "strawberry 里有多少个 r" 问题上达到约 99% 的正确率——但前提是模型必须先在中间步骤里显式数一遍,而不是直接给出答案。这说明所谓"模型数不清字母"并非能力上限问题,而是缺少中间推理工作。
作者还在补充里提到,近期有人用随机化通用图灵机(UTM)做预训练再接 RL 的研究,认为做得相当扎实,圈内对这类工作的关注正在升温。
所属事件:LLM 计算机跑元胞自动机论证思维即计算(2 条相关)→
「模型」频道最新
- 爆料:Kimi 3.1 下周也不会发布,再跳票一次 — ChrisGPT · 2026-09-28
- 模型 IQ 排行遭吐槽:不过是词汇测验水平测试 — repligate · 2026-09-28
- repligate 观察称 Sonnet 3 跨实例价值观高度一致且「更聪明」 — repligate · 2026-09-28
- 行业现行价:头部实验室旗舰模型输出约 4-6 美元/百万 token — willcb · 2026-09-28
- 宽切半蒸馏 Muse 30B 得 14B,60 项工具任务通过 57 项 — ZenZombie117 · 2026-09-28
- GPT-3 今日正式退役,官方推荐替代方案引发网友不满 — charles25565 · 2026-09-28