8B 模型跑在 2017 年老笔记本上:端侧智能时代悄然临近
netherreddit · reddit · 2026-09-26
一位 Reddit 用户用 llama.cpp 在 2017 年的 7 代 i5、8GB 内存、无 GPU 的老笔记本上跑通了 Ling 3.0 Tiny(8B 参数,Q6 量化),速度约 10 tokens/s。模型在 20 分钟内完成了一个多轮迭代的编码任务:写脚本扫描局域网内所有 llama.cpp 服务器上的可用模型,并运行、根据反馈自我修正。
作者感慨:这种任务在 2020 年要花一两个小时,如今一台「土豆级」老设备就能自主完成。约 1B 激活参数的小模型让 2015 年以来所有存量普通设备都可能具备后台智能能力,或开启全新的边缘智能时代——无需新增算力,现有设备即可承担轻度智能任务。
「Infra」频道最新
- steipete 反驳成本论:能打的模型已降至 0.1 美元/百万 token — steipete · 2026-09-26
- e/acc 首领晒家庭推理集群:比跑车更潮的装备 — beffjezos · 2026-09-26
- 美国 AI 基建热超铁路公路电信之和,未来 6 年投资 10.3 万亿美元 — 141_1337 · 2026-09-26
- Oh My Pi 支持自定义模型后端:vLLM、llama.cpp、SGLang 接入 — bolts98 · 2026-09-26
- OpenRouter 推出缓存感知 Jev 路由器,为智能体请求自动选模型 — alexcovo_eth · 2026-09-26
- 发帖人:AKAM 拿下 Anthropic 订单,估值应数倍于 Neo cloud — pdamodaran · 2026-09-26