FreeToken 宣称 MoE 推理速度大幅超越 llamacpp 与 Ollama

wavefnx · x · 2026-08-18

FreeToken 项目声称,在处理混合专家模型时,其推理速度显著优于 llamacpp、ktransfomers、ollama 或 moe-infinity 等现有方案。相关论文已于昨日发布,目前尚未有独立的基准测试结果。虽然项目已提供二进制文件,但源代码已被移除,作者建议在逆向工程之前不要运行该二进制文件。

所属事件:FreeToken 框架宣称大幅加速 MoE 模型推理(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →