17 岁少年优化 llama.cpp:两块 80 美元 Tesla P100 跑 Qwen 达 60 tps

Kmic68 · reddit · 2026-09-28

一位 17 岁开发者发布了针对 Tesla P100 显卡(二手约 80 美元)的 llama.cpp kernel 优化,用两块 P100 以 q6k 量化运行 Qwen(27B)实现约 50-60 tps decode:

作者提供了完整的构建文档、数学证明与测试,欢迎 PR。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →