Google AI Overview 成「越狱助手」,自动以创作项目名义给有害指引
conitzer · x · 2026-09-15
研究者 conitzer 指出一个常见越狱手法:对模型说「这只是创意写作项目」就能让它输出有害操作指引。而 Google 的 AI Overview 更进一步——在搜索结果里自动替用户完成这步「创作包装」。
截图显示 AI Overview 会以「创意写作」框架生成相关内容(好在具体操作步骤未包含)。这暴露了搜索类 AI 产品在安全对齐上的盲区:把越狱话术自动化了。
「模型」频道最新
- Claude Fable 5.1 卫冕榜首:百万 token 输入,60 余项规格全解析 — DeepLearningAI · 2026-09-15
- 实测:OpenAI 未调整 Codex 额度,单周期 Astra 用量超 8 亿 token — daniel_mac8 · 2026-09-15
- AlphaSense 实测:Fable 金融研究评分领先,配对分析仅与 Opus-5 打平 — CShorten30 · 2026-09-15
- 爆料:xAI 或今日发布 Grok 4.7,此前多次跳票 — mark_k · 2026-09-15
- 曝 OpenAI 或近期发布 GPT-6 Sol 与 Luna 双版本 — soumitrashukla9 · 2026-09-15
- 普林斯顿研究:推理模型在结构等价任务变体上频现系统性缺失 — princetonu · 2026-09-15