Redwood: A Frontier AI Accelerator Designed, Verified, and Deployed from Scratch in 2 Weeks by AI
Architect Labs
cs.AR, cs.AI
2026-08-27
两名架构师写高层规格,AI两周内生成RTL、验证与固件并烧到FPGA。Qwen3-0.6B实测平均12.1 token/s,慢于Jetson的28;三星8nm投影49 token/s、功耗1.335W,能效高出3.4倍。
芯片设计按年走,模型按月换。架构一旦冻结,新 workload 对不上,为对冲不确定性堆进去的通用性又白白占面积和功耗。EDA 厂商已经在宣传 AI 把单任务加速一个数量级,把数月工作压到几天。但 2024 年 Wilson 报告里,IC/ASIC 一次流片成功率只有 14%,二十年最低,75% 的项目还在延期。单点提速没有变成整条芯片项目变快。
公开能看到的「AI 生成芯片」也大多停在玩具 RISC-V 核或硬化数值通路,几乎没人把生成物烧到真实硬件上跑现代模型。Redwood 要证明的是另一条路:规格以下全部由 AI 生成,硬件和软件在同一个目标下一起长出来。
Architect Labs(帕洛阿尔托)的平台叫 ALP。两名人类架构师把 workload 和架构约束写成高层规格,规格以下不插手。系统从规格自动生成性能模型、RTL、UVM 验证环境、形式化证明、固件、驱动和自定义 kernel。附录里列了约三十名贡献者,「两名架构师」只覆盖规格这一层。ALP、自研模型、agent harness 和 AI native EDA 工具是事先建好的。所谓从零,指没有预存的加速器 IP,不是从零发明设计流程。
Redwood 面向物理 AI 的单 batch、低功耗、超低延迟推理,空间数据流、tile 阵列。评测用的 Redwood Nano 是 FPGA 配置:2×2 tile,挂在 AMD Versal VPK180 上,250 MHz。每颗 tile 拆成前端和后端。前端是一颗精简 RISC-V 控制核(CRV),跑 kernel 软件;后端是为 Transformer 算子定制的计算单元,脉动 GEMM/GEMV 引擎走整数 MAC 阵列,多通道 SIMD 做逐元素运算、reduction 和 LUT。Softmax 用 FlashAttention-4 的仿真算法,复用已有 SIMD,省掉一块很吃面积的专用电路。每 tile 本地 512 KB SRAM。
前端和后端拆开,是为了让稀疏的控制跑在较慢时钟域,kernel 执行时前端甚至可以关掉。CRV 把任务列表交给 Core Task Manager 之后可以休眠,后端按任务 ID 乱序完成、fence、循环。片上用消息在 tile 和 DMA 之间做显式流量控制,调度从硬件仲裁挪到软件。主机侧先把 Dispatch Program 和 kernel 装进紧耦合指令内存,MCU 配路由表和 DMA,再按 kernel ID 点火。FlashAttention 就是反复向不同 KV block 和 head 发 tile。
完整设计周期两周:从规格到 RTL、验证、固件、自定义 kernel、时序收敛,每个 block 代码覆盖和功能覆盖都到 95%。第三周才把 Qwen3-0.6B 搬上 FPGA。期间每次架构改动,重新生成、重新验证、重新部署到硬件,不超过 48 小时。仓库峰值一天 115 次 merge。第一版 RTL 从仿真落到 FPGA,零 bug。
FPGA 实测和 ASIC 投影是两套数字,必须分开看。
Qwen3-0.6B,生成 128 token 的 decode 平均吞吐:
| 平台 | 吞吐 | 频率 | 带宽 | 功耗 |
| Redwood Nano FPGA | 12.1 token/s | 250 MHz | 16 GB/s LPDDR4 | 未报整板功耗 |
| Jetson Orin Nano(实测) | 28 token/s | 1020 MHz | 68 GB/s LPDDR5 | CPU+GPU 2.59 W |
| Redwood 8nm 投影 | 49 token/s | 1 GHz | 按同档带宽假设 | 1.335 W |
FPGA 上实测 12.1,峰值 13,比 Jetson 的 28 慢一截。250 MHz、16 GB/s、2×2 tile,roofline 就算满也只有 21.73 token/s。一层 decoder 架构延迟 1.241 ms,28 层 34.76 ms,加上 embedding、final norm、LM head 和 argmax,每 token 46.02 ms。内存服务时间是算术的 3.6 倍,decode 卡在访存。若每个算子内部访存和计算都串行,保守上限掉到 17.56 token/s。
投影到三星 8nm(Jetson Orin Nano 同档工艺)、逻辑时钟 1 GHz:最保守估计 49 token/s,约 1.75 倍于 Jetson。NPU 块面积约 2.88 mm²,算法是 200 万组合逻辑加 50 万寄存器,再加 DFT 15%、布局利用率 70%、时钟树等 20%。动态功耗约 0.958 W,漏电 0.07 W,加上其余 SoC 和时钟管理到 1.335 W,且没算架构原生支持的 clock gating。能效 36.7 对 10.8 token/s/W,3.4 倍。两边功耗都只计 host 加加速器计算,不含内存控制器。
如果给到 Jetson 同档带宽,tile 入口仍是最窄一级,约 64 GB/s,架构天花板大约 95 token/s。
跑在 Redwood 上的 Qwen3 被接回设计系统当推理端点,靠反复采样找到若干时序和 kernel 优化,推理成本记为零。论文把这写成递归自我改进的早期演示。
对做边侧、机器人、单 batch 低延迟推理的人,tile 加数据流、为 attention 和 GEMM 定制引擎,和过去几年的 NPU 论文是同一条河。可跟进的是设计闭环:规格改一次,48 小时内重新验证并烧到 FPGA,硬件团队不必再为「模型三个月后换了」去堆通用性对冲。
现在还买不到这块芯片,它停在 FPGA 和纸面投影。能直接用的是一个判断:AI 写 RTL 和 UVM 已经可以撑起一块能跑 0.6B 模型的加速器,范围已经越过玩具核。验证侧「仿真到 FPGA 零 bug」如果可复现,比吞吐数字更值钱。
3.4 倍能效是 8nm 投影对 28 token/s、2.59 W 的纸面比,不是硅上实测。
最大的落差在测量口径。标题和摘要写 frontier、production-worthy,正文评测模型是 Qwen3-0.6B,FPGA 实测 12.1 token/s,慢于对照的 Jetson。Llama 和「数十亿参数」写在摘要里,表里没有对应数字。
ASIC 数字全部是 gate-equivalent 面积模型和 αCV²f 功耗估计,校准来自 FPGA,不是 8nm 硅。未来工作自己写了:物理设计、tapeout、后硅验证都还没做。功耗对比砍掉了内存控制器,而 decode 恰恰是访存墙。
「两周、规格以下零人工」成立的前提是平台和工具链已经就位,规格已经写完。一天 115 次 merge 说明迭代密度高,不说明生成架构已经超过人类设计空间。SIMD 探索被说成能跳出人类认为的最优,论文没有给出这些候选相对人工基线的 PPA 表。
递归自我改进目前是:芯片上跑 Qwen,Qwen 给 kernel 提了些优化。这和「模型设计下一代芯片、芯片再训练更强模型」之间,还有论文自己画的那条能力错位。