从 GPT-1 到 GPT-6 的启示:被低估的架构可能只是缺数据

Silver-Champion-4846 · reddit · 2026-09-21

Reddit 帖子提出一个 scaling 视角的讨论:GPT-1 到 GPT-6 同为 decoder-only 架构,差异来自数据规模、数据质量、SFT 与 RL 等,说明某架构初期的能力不应被视为其上限——「高级自动补全」最终能写代码、解题。作者类比认为,新出现的 Jev 与 Laya 模型或暗示 encoder-only 架构配上海量数据同样可能有惊喜,追问:还有多少被当作「纯理论、无实用价值」而放弃的架构,其实只是被数据饿死了?

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →