Perceptron Multilook API:一次预填视频上下文,成本降至 32%
AkshatS07 · x · 2026-09-05
多模态 API 公司 Perceptron 发布 Multilook API,针对「同一个视频/图片要问多个问题」的场景:媒体上下文只预填充一次,单次调用最多携带 16 个问题并逐题返回结果。
关键数据:
- 成本:16 个问题时输入成本仅为逐题单独请求的 32%;4 个问题时为 46%(约省 2.2 倍)
- 吞吐:高负载下相对逐题请求达 1.6×–3.9×
- 延迟:高负载下中位延迟降低 2×–4.9×
核心思路是省掉对同一帧序列的重复前向计算:传统 Files API 只省上传,省不了每个问题的重复 prefill;Multilook 把一次 prefill 复用到全部问题上,成本节省在任何负载下成立,吞吐与延迟收益在系统繁忙时最明显。已有 API Key 与文档开放使用。
「Infra」频道最新
- ChatGPT/Claude/Grok 同宕机后,网友晒出三机全本地 AI 家庭实验室 — cocktailpeanut · 2026-09-05
- DRAM 密度曲线已趋平:服务器内存 5 年停在 8TB,CXL 成破局关键 — lauriewired · 2026-09-05
- 16GB 显存实测 21 个 Qwen3.8-27B 量化版,bartowski IQ4_XS 夺冠 — Storterald · 2026-09-05
- Nvidia DLSS 5 帧插值在 Stable Diffusion 社区引热议 — KonoTheSavage1 · 2026-09-05
- Dylan Patel 做客 Dwarkesh 播客:马斯克如何玩转算力市场 — Dwarkesh Patel · 2026-09-05
- MiniMax 联手 Together AI 伦敦办活动,聚焦开源模型生产经济学 — MiniMax_AI · 2026-09-05