周末自建 ChatGPT 上下文路由系统并反复压测:78 到 94 分
sam03069 · reddit · 2026-09-14
作者用整个周末给自己的 ChatGPT 定制系统做破坏性测试,最终多模型多轮测试得分在 78/100 到 94/100 之间。
起点很小:为了让 AI 写作不像 AI,他做了一个聚焦自然语言的写作 skill。但跨新对话测试时暴露更大问题——skills、文件、历史对话、项目指令都在,ChatGPT 却无法在新会话中可靠地知道什么重要、去哪找。写作问题变成了上下文问题。
于是搭了路由系统:恢复相关上下文 → 识别正确项目 → 检索历史决策 → 找到事实的真正属主 → 调用合适工具/skill → 验证结果。然后照着清单破坏它:个人事实、历史会话、项目状态、自动化、冲突信息、同名文件、冒充风险、缺失证据、实时 vs 历史状态,并跑遍多个 GPT 模型和推理档位。
得分:GPT-5.5 Medium 78 分,GPT-5.5 High 82 分,GPT-5.6 Medium 92 分,GPT-5.6 High 94 分(READY);独立审计用 GPT-5.6 Sol High 得 91 分(24 通过、3 部分通过、0 失败)。
失败比分数更有价值:跨会话检索仍不稳定;CURRENT-STATE 文件能告诉 ChatGPT 项目停在哪,但不能替代去查真正的 Sheet、收件箱、自动化或数据库。弱路由下的典型错误:注册不等于出席、同名不等于同一人、搜索失败不等于不存在、历史上下文不应覆盖拥有实时事实的系统。
核心教训:把「上下文」拆开——聊天记录记录发生了什么、学习文件记录教训、CURRENT-STATE 帮新会话续接、AGENTS 定义系统规则、skills 定义任务处理、实时系统拥有当前事实。他不需要更大的 prompt,需要更好的路由、清晰的事实属主、身份绑定、验证机制和证据缺失时的处理规则。
「编程与Agent」频道最新
- Grok Bot 可走本地机器,用户借 Mac Mini 突破顽固网站限制 — iannuttall · 2026-09-15
- Cline 桌面版 Early Access:定时任务自动审 PR,解放开源维护者 — Arindam_1729 · 2026-09-15
- G2 推出 Agent 评测:46 个场景实测 10 家客服 Agent,合规率 56%-92% — sanderssays · 2026-09-15
- 弃用 OpenClaw 与 Hermes 后,作者详述重度使用 Muse 半年的 9 个理由 — liuyuxxd · 2026-09-15
- GPT-6 Astra 上手 Codex 全指南:28 个知识点带你入门 — iamrobotbear · 2026-09-15
- Nimble 发布自学习网页研究 Agent,可自动构建结构化数据集 — Shruti_0810 · 2026-09-15