Taalas 实测每秒 1.4 万 token,模型直接烧进硅片
iamfakhrealam · x · 2026-08-31
Emad Mostaque 在直播中演示了 Taalas 的推理速度:ChatGPT 约 100 tokens/秒,Taalas 约 14,000 tokens/秒,相差约 140 倍。其原理是把模型直接「烘焙」进芯片本身,以硬件化方式实现极致推理吞吐。
所属事件:Taalas 演示万级 token 推理,速度约为 ChatGPT 百倍(3 条相关)→
「Infra」频道最新
- Hugging Face 一周收到 4PB 模型与数据集上传 — victormustar · 2026-09-01
- 16GB 显存跑 Qwen 27B:llama.cpp MTP 改版提速 17% — ea_man · 2026-09-01
- 英伟达联发科合作,分析师忧博通长期 XPU 业务 — BenBajarin · 2026-09-01
- 欧盟斥资 3.88 亿欧元打造 LUMI-AI 超算 — wkmyrhang · 2026-09-01
- 传 SK 海力士 HBM4E 基底裸片拟外发给英特尔代工 — AccBalanced · 2026-09-01
- 卫报提议数据中心自发电,实现零碳排放 — nordicinst · 2026-09-01