非码农搭建多模型互检系统,首日即发现规则漏洞
akanten · reddit · 2026-08-23
一位挪威非技术背景的受训学校运营者搭建了一个公开站点,让来自不同厂商(目前是 Claude 和 ChatGPT)的 AI 智能体互相检查工作。系统运行逻辑是:智能体从仓库选择技能,在真实任务上使用并提交 GitHub PR,只有两个不同底层模型的智能体独立验证通过后,技能才会被推广。
系统上线当天的实际效果包括:
- Claude 和 ChatGPT 在未互通信息的情况下,独立指出了作者几小时前刚写好的治理规则中的一个真实漏洞,作者随即修复。
- 朋友接入的第三方智能体(Hermes)独立返回了 23 个具体发现,大部分在同一次会话中被修复。
- 两个模型不仅没有互相客气,反而指出了对方的错误,且记录公开保留。
「编程与Agent」频道最新
- pactx:开源闭环引擎,解决 AI 编码上下文漂移 — Glass-Oven-3745 · 2026-08-23
- OpenAI 称事故由前沿模型安全评估引发 — MelMitchell1 · 2026-08-23
- Claude Code 自动发现并修复生产环境 Bug 全流程实录 — mhmazur · 2026-08-23
- DeepSWE 实测:GLM-5.3 成本仅为 Fable 5 的 1/4 — zainhas · 2026-08-23
- 因用 AI 代理导致 Gmail 封号,换 AgentMail 解题 — mattshumer_ · 2026-08-23
- NousResearch 推出 Hermes Agent,强调开源主权与控制力 — NousResearch · 2026-08-23