用一个模型审计三个厂商的 AI 安全事件档案:从证据核查到修前端一条龙

ValehartProject · reddit · 2026-09-03

作者把此前用 OpenAI、Gemini、Anthropic 模型做过的安全研究存档交给当前模型审计,而非重做研究。整个会话中,模型完成了:质疑早期模型的结论并在证据不足时降级声称强度;区分观察证据、合理推断、假设与过度解读;重建披露时间线并纳入后续证据;联网核实后续安全研究;从 Notion 拉取既有研究对比;分析截图等视觉证据;重估三家厂商的风险分级;维护供应商声明、公开报告、独立验证发现与模型推断之间的来源边界;并据此重写公开的事件记录。

随后切换到实现阶段:仅凭故障界面截图,它诊断并修复了 HTML/CSS 问题、重写组件、加了事件分页导航、动态状态信息和带日期的来源链接。作者认为亮点不在单一功能,而是这些能力能在同一份持久工作上无缝衔接。

他还列出了对新模型 Astra 安全能力的观察清单:能否识别此前模型的过度解读、处理输入时交叉验证、找到前人遗漏、维护证据/来源边界、识别事件间关系而不虚构因果,以及处理大规模证据集时的能力边界。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →