Cactus 发布 8-29MB 端侧模型 Needle 3,树莓派上跑出 4k tokens/s
airesearch12 · x · 2026-09-18
Cactus 发布面向手机、可穿戴、机器人、智能家居、汽车和微控制器的自动化基础模型 Needle 3:整个模型是单个 8-29MB 的二进制文件,基于 Simple Attention Network 构建,一组权重从 2 到 20 层可任意切片,每层深度都是一个独立模型(25-121M 参数,CQ2-bit)。在 Raspberry Pi 5 上本地解码速度可达 4k tokens/s。
核心设计是不做聊天、只做自动化:
- 工具调用:根据应用暴露的函数,从用户话语中选对工具并填全参数;多次请求按序多次调用;没有工具覆盖时返回空列表而非瞎猜
- 结构化抽取:声明 schema,输入混乱文本,返回类型化字段(发票、预订、表单),解码语法保证可解析
- 文本嵌入:同一模型输出句向量,可本地做搜索、匹配和路由
官方称 121M 参数版本在 360B 结构化 token 上训练后,移动端工具调用可击败大 10 倍的模型,抽取任务可匹敌 2-3 倍大的模型,微调版从 4 层起即超过 DeepSeek V4 Flash。产品化场景包括离线语音控家、给扫地机器人下细粒度指令、手机上直接执行操作等。
所属事件:Cactus 发布 Needle 3 端侧模型,树莓派跑出 4k tokens/s(2 条相关)→
「Infra」频道最新
- RTX Pro 6000 上 Ninfer 跑 Qwen3.6 35B 达 600 tok/s — CharlesStross · 2026-09-18
- Cadence:印度EDA市场2031年将达78亿美元 — bookwormengr · 2026-09-18
- Google 开源 Agent Substrate:单机塞千个休眠 Agent,恢复仅 500ms — blaizedsouza · 2026-09-18
- Reddit 网友把 6 张 V100 塞进普通全塔机箱搭本地推理服务器 — Odd_Caterpillar_2994 · 2026-09-18
- Crusoe 融资 39 亿美元建 AI 数据中心,估值达 309 亿 — TechCrunch AI · 2026-09-18
- GPU 编程打卡第 257 天:推荐 2.5 小时半导体供应链入门课 — blaizedsouza · 2026-09-18