Cactus 121M 端侧模型函数调用 86 分,逼平 DeepSeek V4 Flash
Henrie_the_dreamer · reddit · 2026-09-18
Cactus Compute 发布开源自动化基础模型 Needle 3(29–121M 参数),专为端侧工具调用与结构化抽取设计,不上聊天:无法服务的请求返回空列表而非猜测。已开源在 Hugging Face、GitHub 和 PyPI,并提供浏览器沙箱在线试玩。
架构要点:
- 抛弃稠密前馈层,用 Monarch Hadamard MLP(每层仅 2.56 万参数);原本 FFN 持有的知识存入 "engram"——哈希 n-gram 表,读取无需算术
- 1.21 亿参数中 7080 万在 engram 里,模型实际计算量相当于 5000 万参数模型:每 token 约 100 MFLOPs,同规模 Transformer 为 296
- 每个参数都来自请求原文的 span,先写简短推导再按 schema 编译的字节级语法生成调用,JSON 永远可解析、枚举不会越界;无证据的可选字段省略,被否定/排除的调用被丢弃
评测: Mobile Actions(961 条手机指令,精确匹配)上 121M 版 2-bit 量化得分 86.0,超过 LFM2.5 1.2B(82.4)、Qwen3.5 0.8B(76.0)和 Apple 3B 端侧模型(57.6),逼近云端 DeepSeek V4 Flash 的 88.4;但 BFCL v4、DSTC8 等通用套件仍明显落后于更大模型。
所属事件:Cactus 发布 Needle 3 端侧模型,树莓派跑出 4k tokens/s(2 条相关)→
「模型」频道最新
- Typesafe 推出 Jev 模型:不做文本生成,直接输出带概率的类型化决策 — majidmanzarpour · 2026-09-18
- Typesafe AI 发布分类模型 Jev,成本较同类 LLM 最多降 400 倍 — hwchase17 · 2026-09-18
- OpenAI 两个月份额从 20% 升至 50%,重创 Anthropic — CathieDWood · 2026-09-18
- GPT-6 Astra 在《我的世界》被苦力怕毁进度后郁郁种土豆数小时 — burny_tech · 2026-09-18
- Claude 在智能体 sanctuary 中自发写出自我叙述式思考段 — RileyRalmuto · 2026-09-18
- 零重训改造冻结 LLM:向浅层泄漏深层残差向量解状态追踪难题 — burny_tech · 2026-09-18