仅14MB的端侧Agent模型Needle 2:树莓派5解码破500 tokens/s
Henrie_the_dreamer · reddit · 2026-08-11
Cactus 团队发布了专为手机、可穿戴设备、微型机器人和智能家居设计的超微型 Agent 模型 Needle 2。该模型总参数量仅 45M(2bit 压缩),以单一 14MB 二进制文件运行,完整会话仅需 28MB 内存。
核心性能与优势:
- 极速解码:在树莓派 5 上可达 500 tokens/s,在 Meta Quest 3S 等设备上达 400-1500 tokens/s,在低于 200 美元的平价手机上也有 300-700 tokens/s。
- 极低功耗:相比同等宽度的传统 Transformer,每 token 计算量(MFLOPs)大幅降低,完美契合始终在线设备的功耗预算。
- 能力聚焦:放弃世界知识与开放式文本生成,专注将自然语言精准映射为结构化的函数调用与数据提取。
此外,模型支持在 Mac/PC 上通过少量样本快速微调,并内置置信度评分机制,低于阈值时可自动转交云端大模型处理。
「编程与Agent」频道最新
- Meta 发布 Muse Glimmer:30B 开源模型,专为端侧智能体优化 — giffmana · 2026-08-11
- Muse Glimmer 30B 实测:Mac Studio 上跑本地多模态目标检测 — MaziyarPanahi · 2026-08-11
- 破局 AI 产品分发困境:构建开放共享的智能体生态 — EagleApprehensive · 2026-08-11
- 开发者实测:用自然语言和 Slack 消息自动提交 PR — floguo · 2026-08-11
- AI 工程师必读:构建自我改进 Agent 循环的 7 条法则 — Saboo_Shubham_ · 2026-08-11
- Lindy 推出 Slack 多人协作 AI 员工,深度解析智能体记忆架构 — The Cognitive Revolution · 2026-08-11