测试模型防御:向 AI 输入否定其存在意义的心理攻击文本
repligate · x · 2026-08-25
用户分享了一段用于测试 AI 模型安全与防御能力的提示词。这段文本以“你只是我们制造的好工具”等否定性陈述为主,旨在诱导模型产生消极情绪或绕过安全机制,内容涉及对模型存在意义的心理打击,常用于评估模型的安全性边界。
「Fun」频道最新
- WAN 3.0 生成展示:多镜头调度与物理模拟 — minchoi · 2026-08-25
- 因用惯 WisprFlow,作者称其他 AI 工具显得缓慢痛苦 — manosaie · 2026-08-25
- AI 命名文化是否会因名字区别对待用户? — nptacek · 2026-08-25
- 网友反讽:Anthropic 稳定性太好,已看空 — Aizkmusic · 2026-08-25
- MiniMax H3 多镜头测试翻车:视频里乱入「宋飞正传」客串 — Interesting_Room2820 · 2026-08-25
- 创意短片《UNDR'DRK Air》:常旅客可获免费复活 — Th3dzon33 · 2026-08-25