多智能体团队发布多模态智能体框架综述,附开源论文追踪库
MikeShou1 · x · 2026-09-13
来自马里兰大学、牛津、KAUST、新加坡国立等机构的研究者(含 Philip Torr、Mike Zheng Shou 等)在 arXiv 发布综述《A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks》,并被 TMLR 收录。
- 系统梳理多模态智能体系统从感知、推理到记忆、规划与执行的完整技术栈,覆盖图像、视频、音频、GUI 与物理世界等模态
- 同步开源 awesome-multimodal-agents 仓库,持续追踪相关论文、代码、benchmark 与数据集
- 团队欢迎社区贡献与补充
「编程与Agent」频道最新
- Claude Code 的 /goal 与 /loop 各管什么:finish line 与轮询之分 — addyosmani · 2026-09-13
- 程序员调侃:AI 时代没人能再靠两周 CRUD 混故事点了 — tlakomy · 2026-09-13
- 配置 .agent 与 toml 后,Astra 长会话只耗 11% 周额度 — number531 · 2026-09-13
- 用 Langfuse+Postgres 搭 LLM 评测看板,监控幻觉与成本 — goyalshaliniuk · 2026-09-13
- 7 个能写进简历的 AI 项目:RAG、编码 Agent 到本地助手全清单 — goyalshaliniuk · 2026-09-13
- 反直觉省额度法:用小模型编排大模型,用量直接省一半 — sytelus · 2026-09-13