FreeToken:消费级显卡流畅运行 290B+ MoE 模型
SysPsych · reddit · 2026-08-22
FreeToken 是一个边缘原生的混合专家(MoE)推理引擎,旨在个人硬件上运行大规模前沿模型。核心特性包括:
- 快速运行时:支持带宽自适应的 CPU-GPU 协同执行和全层双缓冲预填充。
- 语义感知缓存:支持智能体上下文编辑(如工具调用)避免冗余重计算。
- 弹性内存管理:无需重启即可动态重新分配显存。
- 广泛支持:兼容 DeepSeek-V4、Qwen3.6 等模型,提供 OpenAI/Anthropic 兼容 API,支持 RTX 30/40/50 系列 GPU。
所属事件:伯克利MIT开源FreeToken,消费级显卡可跑290B以上MoE模型(4 条相关)→
「编程与Agent」频道最新
- 250M 参数自研模型:60MB 部署,支持亿级磁盘上下文 — Final-Data-1410 · 2026-08-22
- 加 LLM 裁判自纠错反而掉点:抽取一致性从 85% 跌至 62% — RoadkiLLer_31 · 2026-08-22
- 零人工干预:基于 Polygon 支付的 AI 自主数据 MCP 服务器 — EstablishmentTough18 · 2026-08-22
- Fable 5 对比 Ox Alpha:游戏 Demo 生成仍大幅领先 — ChrisGPT · 2026-08-22
- Agent 安全指南:最小权限原则防级联故障 — blaizedsouza · 2026-08-22
- OpenCode Senses:为本地模型加视觉层 — JeremyCMorgan · 2026-08-22