GPT-3.5 Turbo 跑真浏览器任务:每个修复靠代码而非提示词
tejaskumarlol · reddit · 2026-09-14
作者在 AI Engineer Europe 演讲后复盘:让 GPT-3.5 Turbo 驱动 Playwright 浏览器给 Hacker News 头条点赞,且全程不改提示词,只改 harness,逐步演进:
- v0 裸循环:模型撞上登录墙仍宣称成功——循环只信模型说的"done";
- v1 护栏:代码强制迭代/消息上限,配合粗暴的上下文裁剪,只止损不解决;
- v2 确定性验证:纯代码读 tool call 轨迹判断任务是否真的完成,最多重试 3 次——仍失败但不再撒谎;
- v3 harness 侧登录:检测到登录页时由 harness 用环境变量里的凭据登录(模型看不到),6 次迭代内成功。
核心结论:模型说"完成"只是声明不是证据,要在代码里验证;秘密和脆弱的确定性步骤放 harness 而非提示词;harness 是围绕模型循环之外的一切,有时甚至是"循环外的循环"。
所属事件:开发者用 GPT-3.5 驱动真浏览器完成点赞任务全程不改提示词(2 条相关)→
「编程与Agent」频道最新
- 开发者妙语:本地思考,全局调用工具 — charles_irl · 2026-09-14
- Claude skills 小技巧:还能内嵌可执行脚本 — JeremyNguyenPhD · 2026-09-14
- 企业把 AI 用成昂贵失忆机器:每开新会话都重讲一遍业务 — mhdfaran · 2026-09-14
- 从 JS 工程师到 Omio 首席 AI 工程师:生产级 Agent 系统实战复盘 — js_craft_hq · 2026-09-14
- oh-my-hermes 一体化插件:Claude Code 长期记忆与工作流包 — rlaope · 2026-09-14
- 何时敢让本地编码 Agent 无人值守?Reddit 热议信任harness而非模型 — sunychoudhary · 2026-09-14