把 LLM 路由建模成上下文老虎机,有限反馈下亚线性遗憾

Wang Wei · hf · 2026-09-14

Wang Wei 在 Hugging Face 上发布论文《Online Learning with LLM Experts from Limited Feedback》,研究如何把 prompt 自适应路由到不同 LLM 专家的问题。

核心思路:将 prompt 路由形式化为上下文老虎机(contextual bandit)问题,每次只能拿到有限反馈。

结论:给出 regret 次线性的路由算法,在实践中也能实现有效的专家路由,为低成本地在多个 LLM 之间分配请求提供了理论支撑。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →