实战:用 RL 自我进化设计芯片,Kimi K3 跑出 87000 tps
brianryhuang · x · 2026-08-24
这篇博客展示了如何使用强化学习(RL)和 LLM 重新设计 Kimi K3 芯片,实现从 RTL 到 GDS 的全流程自动化。
核心成果:
- Phase 1: 重建 K3 的 16x16 MAC 阵列,面积 4mm²,频率达 1047 MHz(原设计 100 MHz)。
- Phase 2: 构建完整的 KDA 数据流加速器,布线后频率达 900 MHz。
- 性能推算: 最佳设计理论上能让 Kimi K3 达到 87000 tps,比官方示例快 10 倍。
技术细节:
- 解释了 ASIC(固定流水线,权重在片上 SRAM)与 GPU 的区别,指出 KDA 固定状态大小使其适合 ASIC 实现。
- 系统具备自我纠错能力,曾搞砸 SRAM 综合后自我修正,形成了“Meta Harness”自我进化循环。
- 相关设计文件已开源。
「Infra」频道最新
- AI 数据中心正重塑电力市场与基建布局 — VraserX · 2026-08-24
- 加密矿工加速转型 AI:每度电收益远超挖币 — alvelda · 2026-08-24
- 小米发布本地 AI 主机,搭载三款自研芯片支持双模型 — op7418 · 2026-08-24
- 马斯克称 AI 与机器人将引爆带宽需求 — XFreeze · 2026-08-24
- 求助:Docker 下部署本地 Qwen3.8 FP8 遇阻 — EbbNorth7735 · 2026-08-24
- 实测 RTX 5000 Pro 跑 Qwen3.8 性价比炸裂 — Valuable-Run2129 · 2026-08-24