通过测试不等于安全:AI Agent 应约束权限而非仅约束输出
WirelessLife · x · 2026-09-04
作者提出一个 AI 安全观点:Agent 通过测试并不能说明它是安全的,真正的安全保障在于限制其权限边界,而不仅仅是约束其输出内容。
「安全」频道最新
- GitHub 出现未上报漏洞 PoC 合集 exploitarium: 收录大量 0-day 级利用 — udmrzn · 2026-09-04
- 研究:沿「自动评分者/人类评估者」维度 steer Qwen,人格随之怪变 — voooooogel · 2026-09-04
- 英国 AISI 实测 GPT-6 Astra:单次前向数学时距 30.9 分钟,为前代 8 倍 — teortaxesTex · 2026-09-04
- 英国 AISI:Astra 可执行开源供应链攻击等恶意行为 — zephyr_z9 · 2026-09-04
- GPT-6 Astra 系统卡公开,OpenAI 发布部署安全评估报告 — itchyfeetleech · 2026-09-04
- 研究挑战 Emergent Misalignment:模型「邪恶」可在训练前预测 — ChenhaoTan · 2026-09-04