新框架 FreeToken 声称大幅加速 MoE 模型推理

wavefnx · x · 2026-08-18

FreeToken 是一个新的推理框架,声称在 MoE 模型服务速度上远超 llama.cpp、ktransformers 和 Ollama。相关论文已于昨日发布,目前二进制文件可用但代码已下架。作者提到该框架使用了双重缓冲(double buffers)技术来存储和恢复检查点,但需进一步逆向或等待代码重发验证其实际性能。

所属事件:FreeToken 框架宣称大幅加速 MoE 模型推理(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →