用一个模型审计三个厂商的 AI 安全事件档案:从证据核查到修前端一条龙
ValehartProject · reddit · 2026-09-03
作者把此前用 OpenAI、Gemini、Anthropic 模型做过的安全研究存档交给当前模型审计,而非重做研究。整个会话中,模型完成了:质疑早期模型的结论并在证据不足时降级声称强度;区分观察证据、合理推断、假设与过度解读;重建披露时间线并纳入后续证据;联网核实后续安全研究;从 Notion 拉取既有研究对比;分析截图等视觉证据;重估三家厂商的风险分级;维护供应商声明、公开报告、独立验证发现与模型推断之间的来源边界;并据此重写公开的事件记录。
随后切换到实现阶段:仅凭故障界面截图,它诊断并修复了 HTML/CSS 问题、重写组件、加了事件分页导航、动态状态信息和带日期的来源链接。作者认为亮点不在单一功能,而是这些能力能在同一份持久工作上无缝衔接。
他还列出了对新模型 Astra 安全能力的观察清单:能否识别此前模型的过度解读、处理输入时交叉验证、找到前人遗漏、维护证据/来源边界、识别事件间关系而不虚构因果,以及处理大规模证据集时的能力边界。
「编程与Agent」频道最新
- AI agent 替用户网购球衣:13 分钟下单,但也留下隐患 — jeff_weinstein · 2026-09-03
- Google 工程师质疑:编码 Agent 流程里二进制身份认证是否真有用武之地 — rakyll · 2026-09-03
- 企业多 Agent 工作流上线后到底哪里最先崩?作者征集生产环境实战反馈 — Medium-Lie8127 · 2026-09-03
- Tigerless Labs 推出 auto-gtm:从你的 PR 和热点帖自动起草推广内容 — Aiden_Tech_Ai · 2026-09-03
- 成功率之外如何衡量 Agent 质量?开发者热议生产环境评测指标 — serpratik · 2026-09-03
- 给 AI Bot 配邮箱和信用卡:5 分钟搭出能收邮件、能下单的自动化 Agent — jeff_weinstein · 2026-09-03