Taalas 把 Llama 3.1 8B 烧进定制芯片,实测每秒 15000 tokens
npew · x · 2026-09-04
芯片公司 Taalas 将 Llama 3.1 8B 直接「烧录」进定制硅片,演示达到每秒 15000 tokens 的生成速度,读者可在其网站直观感受。OpenAI 前高管 Nathan Peter( npew)转发并展望:未来几年若同等速度跑 GPT-6 Astra 级别的模型、甚至每部手机都内置此类芯片,推理将接近「即时」,体验将彻底改变。定制 ASIC 存储内计算的路线值得关注。
「Infra」频道最新
- Spotify 工程团队用 Portal 路由策略,砍掉 90% Claude Code token — rseroter · 2026-09-04
- 开源桌面工作台 Vyact:本地模型+文档 RAG+浏览器上下文一站集成 — vyact · 2026-09-04
- KV 量化在多深上下文开始劣化?F16 vs Q8/Q4 序列对齐 PoC — Slight_Analysis_5414 · 2026-09-04
- KV 缓存:自回归 LLM 推理的根基性优化,用内存换算力 — alec_helbling · 2026-09-04
- WSJ:数据中心让路易斯安那小县居民「集体中彩票」 — robleclerc · 2026-09-04
- 无编排器无 MCP:4 个对等 Agent 通过 gossip 组网完成真实调研任务 — Trainer_Intelligent · 2026-09-04