Phalanx 安全防御平台公测,邀你攻击受保护的 LLM
TheWrongSudoku · reddit · 2026-08-15
- 平台功能:Phalanx vs the World 提供了一个双通道竞技场,同时运行“裸模型”和受确定性指令控制层保护的模型,对比两者在面对攻击时的表现。
- 攻击方式:支持直接越狱、多轮施压和文本文件注入攻击。系统会生成公开的红字收据,但不发布原始的有害提示词和补全内容。
- 防护机制:Phalanx 层对请求返回 Pass/Hold/Block 决策,能处理不受信内容(如检索文本、文件、工具输出)作为数据使用,防止其获得指令权限。
- 运营限制:由个人开发者运营,采用候补室机制控制并发量,以防止系统崩溃或成本失控。
- 目标:作者希望社区进行高强度攻击,以测试防护层的可信度并收集反馈。
「安全」频道最新
- Anthropic宣布新Claude模型将嵌入不可见文本水印,全球范围生效 — suchenzang · 2026-08-16
- 谷歌曾于 2011 年尝试类似文本水印技术 — yoavgo · 2026-08-16
- 当 AI Agent 做出错误决策谁该负责? — KKevinjad · 2026-08-16
- 利用哈希匹配频率检测 AI 文本水印 — binarybits · 2026-08-16
- AI 水印检测依赖原始 Logits 与提示词 — binarybits · 2026-08-16
- Claude 水印引发误报,Anthropic 回应技术细节 — deliprao · 2026-08-16