用MCP与视觉模型实现桌面自动化
sarthi_education · reddit · 2026-07-12
作者分享了利用AI控制远程桌面完成复杂多步工作的实践。核心理念是让AI像人类一样使用鼠标和键盘,而非依赖脚本,从而自动化非API或对API不友好的服务。 **技术实现细节:** - **视觉控制**:利用Nvidia NIM等服务在屏幕上投射坐标图,辅助视觉模型选择像素点并执行操作。 - **技能与编排**:为不同网站编写技能文档,决定何时用Python脚本、何时用鼠标键盘。采用“1个子任务1个Agent”的编排模式,通过Markdown文件追踪指令与进度。 **应用场景**:已成功用于自动化制作AI视频系列,并为客户开发了能控制其软件并通过手机聊天机器人服务客户的Agent。
所属事件:利用视觉模型与MCP实现桌面自动化实战(2 条相关)→
「编程与Agent」频道最新
- 一个 GitHub 集合收录 100+ 个开源 AI agents 和 RAG 应用 — Saboo_Shubham_ · 2026-07-21
- 微软提出像训练神经网络一样训练 agent 技能 — Saboo_Shubham_ · 2026-07-21
- Freerange 说大型开源 UI 验证项目已接近当前 AI 上限 — jxnlco · 2026-07-21
- 开发者删掉 linting 和类型检查后,agent 反而更自由 — hichaelmart · 2026-07-21
- Freerange 可静态证明 UI 代码数值范围,无需运行应用 — cnakazawa · 2026-07-21
- pen.dev 让多家前沿模型并行评测前端设计 — yakuzeg · 2026-07-21