Liquid AI 主张端侧跑 Agent:350M-2.6B 模型,推理零按 token 计费

JosephJacks_ · x · 2026-09-28

Liquid AI 在旧金山 AWS Builder Loft 活动上阐述端侧 Agent 推理方案。ML 工程师 Tianshu Yu 介绍其模型阵容:350M 至约 2.6B 的文本模型、一个 3B 视觉语言模型及音频能力,可经 llama.cpp 在设备上运行,或用 vLLM/SGLang 支持高并发,也接入 OpenRouter。

端侧四大理由:推理免费(无按 token 账单)、超低延迟、隐私(医疗客户数据留在自己服务器)、离线也能工作。三大难点:模型要小到能装进手机、要在 CPU/NPU 而非 GPU 上跑得快、还要擅长 agentic 任务。他的判断是:"如今我们更关心模型会做事,而不是当聊天机器人。"

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →