从 GPT-1 到 GPT-6 的启示:被低估的架构可能只是缺数据
Silver-Champion-4846 · reddit · 2026-09-21
Reddit 帖子提出一个 scaling 视角的讨论:GPT-1 到 GPT-6 同为 decoder-only 架构,差异来自数据规模、数据质量、SFT 与 RL 等,说明某架构初期的能力不应被视为其上限——「高级自动补全」最终能写代码、解题。作者类比认为,新出现的 Jev 与 Laya 模型或暗示 encoder-only 架构配上海量数据同样可能有惊喜,追问:还有多少被当作「纯理论、无实用价值」而放弃的架构,其实只是被数据饿死了?
「漫话AGI」频道最新
- 开发者激辩:代码审查自动化后,新手还该不该学编程 — mgill25 · 2026-09-21
- OpenAI 研究员 Noam Brown:对齐的 AI 员工或让大公司反超初创 — victor_explore · 2026-09-21
- 质疑:若真信 p(doom)>0,为何还在实验室加速研发? — _arohan_ · 2026-09-21
- AI 助手悖论:没人想一天做十个决策 — menhguin · 2026-09-21
- Daniel Mac:我们竟能争论当下 AI 是否已 AGI,本身就很惊人 — daniel_mac8 · 2026-09-21
- Reddit 热帖:AI 公司鼓吹安全监管实为抬高对手成本卡特尔 — crua9 · 2026-09-21