CAST: 通过批判感知监督提升长程 Agent 工具调用可靠性
Amir Saeidi · hf · 2026-09-01
CAST 旨在提高 LLM Agent 在长程任务中的可靠性。它通过从稀疏结果中生成结构化的动作级理据,以此训练批判模型 和策略模型,从而优化 Agent 的决策过程。
「研究」频道最新
- 研究发现:提速后模仿学习灵巧操作比专家退化更严重 — UMCP · 2026-09-03
- Meta 提出 Switch Distillation:中训练蒸馏保推理不伤事实回忆 — meta · 2026-09-03
- Sebastian Raschka 拆解 The Information 的 OpenAI Astra「循环Transformer」传闻 — rasbt · 2026-09-03
- 技术圈质疑 Astra 循环架构:最可能只是每层跑两遍的调度 — mike64_t · 2026-09-03
- 研究者入选 Cosmos 计划,三个月攻关 LLM 思维忠实性 — hunarbatra · 2026-09-03
- Video Delta Net 让开源视频生成提速 75–90 倍,14 秒视频 11 秒生成 — xiuyu_l · 2026-09-03