周末自建 ChatGPT 上下文路由系统并反复压测:78 到 94 分

sam03069 · reddit · 2026-09-14

作者用整个周末给自己的 ChatGPT 定制系统做破坏性测试,最终多模型多轮测试得分在 78/100 到 94/100 之间。

起点很小:为了让 AI 写作不像 AI,他做了一个聚焦自然语言的写作 skill。但跨新对话测试时暴露更大问题——skills、文件、历史对话、项目指令都在,ChatGPT 却无法在新会话中可靠地知道什么重要、去哪找。写作问题变成了上下文问题。

于是搭了路由系统:恢复相关上下文 → 识别正确项目 → 检索历史决策 → 找到事实的真正属主 → 调用合适工具/skill → 验证结果。然后照着清单破坏它:个人事实、历史会话、项目状态、自动化、冲突信息、同名文件、冒充风险、缺失证据、实时 vs 历史状态,并跑遍多个 GPT 模型和推理档位。

得分:GPT-5.5 Medium 78 分,GPT-5.5 High 82 分,GPT-5.6 Medium 92 分,GPT-5.6 High 94 分(READY);独立审计用 GPT-5.6 Sol High 得 91 分(24 通过、3 部分通过、0 失败)。

失败比分数更有价值:跨会话检索仍不稳定;CURRENT-STATE 文件能告诉 ChatGPT 项目停在哪,但不能替代去查真正的 Sheet、收件箱、自动化或数据库。弱路由下的典型错误:注册不等于出席、同名不等于同一人、搜索失败不等于不存在、历史上下文不应覆盖拥有实时事实的系统。

核心教训:把「上下文」拆开——聊天记录记录发生了什么、学习文件记录教训、CURRENT-STATE 帮新会话续接、AGENTS 定义系统规则、skills 定义任务处理、实时系统拥有当前事实。他不需要更大的 prompt,需要更好的路由、清晰的事实属主、身份绑定、验证机制和证据缺失时的处理规则。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →