工程师质疑 DeepSeek 带火的 inline PTX 热潮:写汇编不等于高性能
mike64_t · x · 2026-09-14
工程师 mike64t 发文质疑 DeepSeek 此前引发的 inline PTX 热潮,认为直接写 PTX 并不直接代表性能优势,不是"像写汇编那样就能更快"的道理。他指出讽刺的是 AMD 的情况反而更接近这一说法——基本只能写内联汇编块才能逼近 roofline,而其根源主要是 LLVM 寄存器分配不佳。在后续回复中他补充:同意"在合格的人类架构设计指导下,agent 爬坡的训练栈难以被竞争"这一大结论,但不确定 SpaceX 实际在做这件事。
所属事件:工程师质疑PTX热潮并讨论Agent优化训练栈(2 条相关)→
「Infra」频道最新
- Maia 200 每 1mm² 达约 12 TFLOP/s FP4,密度成第一设计目标 — thoefler · 2026-09-14
- 开发者晒 24/7 自托管 AI 栈:Open WebUI+Pidot+Tailscale 接 GLM/DeepSeek — andfanilo · 2026-09-14
- 网友揪出光子公司宣传图破绽:整张芯片图是镜像拼接的 — jwt0625 · 2026-09-14
- M3 Ultra 本地跑 Qwen3.8-Flash-Next:预填充 559 t/s,解码 31 t/s — rm-rf-rm · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RTX 5090 现货几近断货,价格或将进一步失控 — DustNearby2848 · 2026-09-14