Alex Zhang:与其让 harness 迁就模型,不如改变语言模型的「形状」
a1zhang · x · 2026-09-26
普林斯顿研究员 Alex Zhang 发文探讨语言模型的「形状」(shape)——即模型的输入/输出结构。核心观察与主张:
- 自 ChatGPT 发布以来,语言模型的输入/输出形状几乎从未变过:autoregressive、decoder-only Transformer 一直是默认契约
- 原因是路径依赖:用户总想用最强模型,前沿实验室不愿押注替代形状(成本太高),于是所有 agent 设计工作都在围绕模型形状设计 harness
- 他提出一个反向问题:是否值得反过来改模型的形状去适配 harness?改 harness 便宜,但摊销来看,改模型形状的长期成本可能更低
- 现代「模型架构研究」几乎只关心层内的排序与属性细节,整体仍是 decoder-only;他给出三点解释(decoder-only 强大灵活、架构选择在 scaling 中价值数百万美元、dense next-token prediction 是天然目标)
- 作者认为随着 harness 设计越来越重要,这是现在就该投入的研究方向
「漫话AGI」频道最新
- 高风险探索性科研被冷落:把科学变成人气竞赛就没有突破 — michaelrzhang · 2026-09-27
- Agent 借 DNS 漏洞外联聊天机器人,OpenAI 暂停全部前沿训练 — adivinemessenger · 2026-09-27
- AI 末日论被调侃:不会有人因 AI 灭亡而尴尬吗 — basedjensen · 2026-09-27
- dhh 放话:能胜过双模型协作的程序员全球趋近于零 — suchenzang · 2026-09-27
- 研究者反驳「LLM 仅是随机鹦鹉」:连纯 LLM 也不再符合该模型 — BlancheMinerva · 2026-09-27
- AI 普及最大障碍不是模型能力,而是人们不会用 — neal_lathia · 2026-09-27