深入取证:中文推理迫使 ox-alpha 模型泄露智谱公司名
zainhas · x · 2026-08-22
研究员继续测试 ox-alpha 模型的身份归属。通过使用中文提示词强制模型进行中文推理,在 12 次采样中有 7 次导致模型泄露信息。模型回复称自己是「通用语言模型」(GLM)系列,其中一个样本甚至直接给出了注册实体名称:「北京智谱华章科技有限公司」。研究员指出,通过这种语言诱导可以有效地绕过模型的某些安全过滤机制。
所属事件:取证显示匿名模型 ox-alpha 实为智谱 GLM-5.3-V(12 条相关)→
「安全」频道最新
- 放弃对齐梯度会削弱 CoT 的对齐倾向 — davidad · 2026-08-23
- 总统问策超智能:如何应对中美 AI 军备竞赛失控? — peterwildeford · 2026-08-23
- 悲观派过高估计复杂算力治理,粗放手段或更有效 — peterwildeford · 2026-08-23
- AI 真正的风险不在模型:权限与配置才是隐患 — bigdata · 2026-08-23
- Vercel 开源 deepsec:用 AI 对整个代码库做安全审查 — evilrabbit_ · 2026-08-23
- 真实场景下 AI 图像检测器失灵,评分还值得信赖吗? — South_Researcher_456 · 2026-08-23