研究者警示逐行调用 LLM API 低效,Quail 用 Qwen3-4B 六秒完成五千条过滤

UC 研究者 Shreya Shankar 介绍开源 AI-SQL 引擎 Quail 的成本估算方法,指出对数千行数据逐行调用 LLM API 是糟糕方案,因为无法受益于查询规划。她用 roofline 模型估算延迟:在单张 H100 上用 Qwen3-4B 做批量决策,过滤 5000 条评论仅约 6.6 秒。Hamel Husain 转发并赞同这一批量决策模型的观点,认为逐行调用性能远非最优。

2026-10-02 ~ 2026-10-02 · 2 条相关