仅凭 3 个计数示例,gpt-3.5-turbo 也能答对 99% 的 strawberry 题

ctjlewis · x · 2026-09-28

作者 ctjlewis 介绍其论文的核心观点:思维本质上是可计算的。今天 LLM 用自然语言做"推理",与他论文的做法在结构上是同构的,只是载体从符号变成了概念。

论文的关键实验是:只需在 prompt 里加入约 3 个"逐字母计数"的示例,就能让 gpt-3.5-turbo 在经典的 "strawberry 里有多少个 r" 问题上达到约 99% 的正确率——但前提是模型必须先在中间步骤里显式数一遍,而不是直接给出答案。这说明所谓"模型数不清字母"并非能力上限问题,而是缺少中间推理工作。

作者还在补充里提到,近期有人用随机化通用图灵机(UTM)做预训练再接 RL 的研究,认为做得相当扎实,圈内对这类工作的关注正在升温。

所属事件:LLM 计算机跑元胞自动机论证思维即计算(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →