antirez:本地推理关键在缩短思考与加速 prefill

Redis 作者 antirez 发推谈本地大模型推理的选型思路,认为不应把每秒生成 token 数当作主要指标。他预测中国开源模型厂商终将意识到,真正的竞争点是把思考阶段尽可能缩短,而快 prefill 加上每秒 20-30 个 token 的生成速度就足以满足本地推理需求。

2026-09-29 ~ 2026-09-29 · 2 条相关