Taalas 将 Llama 3.1 烧录进定制芯片,推理速度达 1.5 万 tokens/秒

generativist · x · 2026-08-01

Taalas 推出的 ChatJimmy 展示了一种激进的 AI 推理硬件方案:它将 Llama 3.1 8B 模型直接“烧录”进定制硅片中。

这种做法绕过了传统的内存带宽瓶颈,使其运行速度高达约 15,000 tokens/秒。用户反馈其响应速度极快,甚至在键盘松开 Return 键的物理触感产生前,完整的生成结果就已经返回。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →