Taalas 实测每秒 1.4 万 token,模型直接烧进硅片

iamfakhrealam · x · 2026-08-31

Emad Mostaque 在直播中演示了 Taalas 的推理速度:ChatGPT 约 100 tokens/秒,Taalas 约 14,000 tokens/秒,相差约 140 倍。其原理是把模型直接「烘焙」进芯片本身,以硬件化方式实现极致推理吞吐。

所属事件:Taalas 演示万级 token 推理,速度约为 ChatGPT 百倍(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →