Transformer 或在做的远不止「预测下一个词」

soleio · x · 2026-08-25

Soleio 转发了一篇关于 Transformer 机制的观点文章,指出「它只是一个统计机器,预测下一个 token」是对 Transformer 最常见也最具误导性的描述之一。

文章的核心论点是:训练目标告诉你系统在优化什么,但并不必然告诉你系统为了实现目标而发现的内部计算。当研究者打开 Transformer 内部观察,同时神经科学家观察大脑神经元群体时,两者呈现出有趣的共性——这暗示模型内部可能形成了比「逐词统计」更丰富的计算结构。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →