手写 CS224n Transformer:144 行代码暴露尺度与掩码坑
stanfordnlp · x · 2026-10-02
- 一位开发者跟随 Stanford CS224n 第 8 讲(John Hewitt)从零手写 Self-Attention 与 Transformer,首版即通过 37 项测试中的 35 项,全程 144 行代码。
- 缩放因子:点积不除以 √d 时,某词对另两个词的注意力权重达 0.999,交换这两个词输出仅移动 0.0003;加上缩放后变为 0.096——这是测试能捕捉到的隐性行为差异。
- 因果掩码:漏掉 mask 不会报错,但训练 loss 直降至 0.037——模型直接从输入里读答案。作者由此提炼出测试策略:只改动 critic 可见的 3 个值,action 必须不动。
- 随后搭了个 2 层 decoder(127,872 参数),在笔记本上用莎士比亚语料训练 3000 步,验证集 loss 从 4.650 降到 1.850。
「研究」频道最新
- 华科团队提出 Multimodal Flow:语言与视觉的全连续统一建模 — hustvl · 2026-10-02
- 快手提出 DARA:多奖励 RL 训练步数最多省 65%,代码开源 — kuaishou · 2026-10-02
- Argo-Bench:235 表企业级仓库考数据 agent,最强模型仅 34.8% 任务达标 — textql · 2026-10-02
- OpenAI 研究员发布 LoopCD:循环 Transformer 解码免费涨分,AIME 61.9%→73.3% — arankomatsuzaki · 2026-10-02
- Jev 是否在隐式学习价值函数?RL 校准与双系统决策探析 — lateinteraction · 2026-10-02
- MLPerf 引入 DLRMv4:HSTU 序列建模+560GB 嵌入的生产级推荐基准 — TheKanter · 2026-10-02