开源决策模型 Laya 移植 Core ML,99.5% 算子跑上 ANE,单次决策 3.7ms

alexcovo_eth · x · 2026-09-22

开发者 Alextramemory 宣布将开源 Jev 式决策模型 Laya 移植到 Core ML,99.5% 的算子运行在 Apple Neural Engine 上,在 M5 Pro 上单次决策仅需 3.7ms。原版 Laya 号称约 27ms 出结果,比调用托管 LLM 快约 200 倍,还曾演示自主玩俄罗斯方块。

FluidUse 0.2.0 提供 Swift 移植:单次编码即可输出 choice/score/noul 三类答案并带校准概率,无需生成 token;支持 128/256/512/1024 token × 32 选项的定长 Core ML 桶,fp16 或 e8 量化(int8 嵌入表体积小 30% 且精度不变);在 Laya 公布的 10 个评测套件(3899 条)上精度与 PyTorch 完全一致,俄罗斯方块演示每分钟可做约 15800 次决策。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →