快慢模型何时切换?研究:延迟 30% 最不确定决策收益最大

Gian Luca Bailo · hf · 2026-10-09

论文 System Switch 研究双过程 Agent 的一个核心问题:快速决策模型何时该停下来交给慢速推理模型(VLM)。设定是快速 learned actor 处理所有决策,仅在「门」打开时移交给推理模型,游戏持续运行。基于闭环 Doom 和新的开源 "System One" 类型化决策模型(0.15B-9B),通过 llama.cpp 统一接口服务。

在 900 个留出问题上的发现:

代码、prompt、数据和日志全部开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →