Reka EdgeQ 端侧 VLM 登陆骁龙 8 Elite,首 token 仅 0.73 秒
RekaAILabs · x · 2026-09-23
Reka 发布针对终端设备优化的端侧视觉语言模型 Reka EdgeQ,原生运行在骁龙 8 Elite 的 Hexagon NPU 上,面向可穿戴与手机等极限功耗场景。
- 图像输入首 token 延迟 0.73 秒
- MLVU 视频基准比 Gemma 4 E4B 高 34 分
- 单次推理能耗 6.9 mWh,热开销约降低 3 倍
- 针对 NPU 定制调优 ConvNeXt V2 视觉编码器/解码器,GPU 完全空闲,持续负载下避免热降频
官方附技术解析博客。
「Infra」频道最新
- 绿 awful awkt: Showcasing Undersea Internet Cables at the UN — EricTopol · 2026-09-23
- NVIDIA 直播解读:CUDA 全栈如何一套平台支撑金融医疗制造多行业 AI — NVIDIA Developer · 2026-09-23
- vLLM 引入硬件无关层:H100 吞吐仅损失 3.4%,兼顾前沿性能与移植性 — PyTorch · 2026-09-23
- 421M 参数 Laya 模型经 OpenVINO INT8 量化后纯 CPU 玩 Flappy Bird — simpleuserhere · 2026-09-23
- 16GB 显存跑 Qwen3.8-27B 上 160k 上下文,全套配置公开 — According_Study_162 · 2026-09-23
- MLX-Serve 发布 v26.95:Qwen-Image 2.1 上 Mac,四路并发提速近一倍 — TheMoonMidas · 2026-09-23