460M视觉模型仅用64个token,iPhone端首字延迟降至0.3秒

BTA_Labs · reddit · 2026-08-05

VisionPsy-Nano-460M-Flash 是一款针对端侧部署优化的 460M 参数视觉语言模型(VLM)。它通过一种极简机制大幅提升了手机端的推理速度:将视觉 token 数量压缩至仅 64 个。

作者也客观指出了目前的局限性:0.3 秒仅为首字延迟,且当前依赖特定的 llama.cpp 分支,上下文限制在 8K,更适合单图查询场景。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →