460M视觉模型仅用64个token,iPhone端首字延迟降至0.3秒
BTA_Labs · reddit · 2026-08-05
VisionPsy-Nano-460M-Flash 是一款针对端侧部署优化的 460M 参数视觉语言模型(VLM)。它通过一种极简机制大幅提升了手机端的推理速度:将视觉 token 数量压缩至仅 64 个。
- 核心机制:不同于其他主流小型 VLM(如 SmolVLM2 或 nanoVLM 通常需要 1088 个视觉 token),该模型避免了将图像放大后再切分的传统做法,而是直接保留原生分辨率(最小 512x512),从而避免了无意义的像素产生额外 token。
- 性能表现:在 Q4 量化下,iPhone 15 的首字延迟(TTFT)仅需 0.3 秒,而同级别模型往往需要数秒甚至更久。完整生成一句图片描述也仅需 0.7 秒。
- 质量权衡:在保留约 99% 基准分数(62.3 vs 61.4)的同时,这种激进压缩对 OCR 和细节密集型任务(如 TextVQA)造成了明显的质量损失。
作者也客观指出了目前的局限性:0.3 秒仅为首字延迟,且当前依赖特定的 llama.cpp 分支,上下文限制在 8K,更适合单图查询场景。
「Infra」频道最新
- 华尔街预计 AI 基建狂飙:OpenAI 明年单季资本支出或超 180 亿美元 — PTrubey · 2026-08-05
- 4090 实测 MiniMax H3:Sage Attention 节点让生成时间暴降 — thegr8anand · 2026-08-05
- 3090 升级抉择:24G 显存够用还是直上 32G? — gtech02 · 2026-08-05
- 斯坦福 Hazy Research:AI Agent 正在让 CUDA 抽象层退役 — sumitdotml · 2026-08-05
- AI智能体自主编写Triton内核,打破 NanoGPT 训练速度记录 — cong_ml · 2026-08-05
- 英伟达股价大涨,创两个月来新高 — Polymarket · 2026-08-05