微调提示词和状态,让模型仅凭视觉完成任务
mervenoyann · x · 2026-07-23
作者说自己稍微改了 prompt,并加入了一些额外状态,但仍然希望模型只靠视觉就能完成任务。
在回复里,他还让 Ben Burtenshaw 去看 OpenEnv,建议自己搭一个环境来做实验。整体更像是在讨论如何搭建和验证视觉型 agent 工作流,而不是单纯聊模型能力。
「编程与Agent」频道最新
- Factory 联创预测:未来两年内 90% 的编程 Agent 将实现完全自主 — matanSF · 2026-07-23
- 语音助手把后端迁到欧洲后,工具调用立刻变快 — ur_piyo_a_hoe · 2026-07-23
- W&B 的 Scott Condron 想重回开发者关系:押注研究代理与评测界面 — _ScottCondron · 2026-07-23
- Clean Plate LoRA 样例展示了视频清场工作流 — nazihater3000 · 2026-07-23
- DeepWiki实测:一键解析Three.js游戏智能体技能系统 — majidmanzarpour · 2026-07-23
- DeepWiki 指向一个 three.js 游戏 Agent 技能系统 — ruthstarkman · 2026-07-23