Taalas 把 Llama 3.1 8B 烧进定制芯片,实测每秒 15000 tokens

npew · x · 2026-09-04

芯片公司 Taalas 将 Llama 3.1 8B 直接「烧录」进定制硅片,演示达到每秒 15000 tokens 的生成速度,读者可在其网站直观感受。OpenAI 前高管 Nathan Peter( npew)转发并展望:未来几年若同等速度跑 GPT-6 Astra 级别的模型、甚至每部手机都内置此类芯片,推理将接近「即时」,体验将彻底改变。定制 ASIC 存储内计算的路线值得关注。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →