Taalas 将 Llama 3.1 烧录进定制芯片,推理速度达 1.5 万 tokens/秒
generativist · x · 2026-08-01
Taalas 推出的 ChatJimmy 展示了一种激进的 AI 推理硬件方案:它将 Llama 3.1 8B 模型直接“烧录”进定制硅片中。
这种做法绕过了传统的内存带宽瓶颈,使其运行速度高达约 15,000 tokens/秒。用户反馈其响应速度极快,甚至在键盘松开 Return 键的物理触感产生前,完整的生成结果就已经返回。
「Infra」频道最新
- 传欧洲芯片巨头 NXP 拟收购自动驾驶 AI 芯片厂商 Ambarella — pstAsiatech · 2026-08-01
- 消费级笔记本跑通2.78万亿参数Kimi K3全量模型 — rickasaurus · 2026-08-01
- CXMT LPDDR6 内存接近量产,速率达 12800Mbps — bookwormengr · 2026-08-01
- OpenAI 巨型单体仓库遇性能瓶颈,团队向 Git 上游提交优化补丁 — charliermarsh · 2026-08-01
- 算力账单揭秘:国产大模型在AI编程场景为何“叫好不叫座” — 创业邦 · 2026-08-01
- 4张5060 Ti本地跑DeepSeek:128k上下文速度实测 — Ambitious_Fold_2874 · 2026-08-01