AI 安全研究者签证被撤缺席 COLM,白盒监控可被模型规避
xuanalogue · x · 2026-10-09
- AI 安全研究者 Fazl Barez 因美国签证被撤销(细节未公开,并呼吁遇到同类情况的 AI safety 研究者联系他)无法赴 SF 参加 COLM 会议。
- 其团队在会上展示论文海报:研究「AI 能否学会对能查看模型内部的白盒监控器隐藏自己的行为」,分析了白盒监控可被规避的方式,并提出让监控器更难被欺骗的方法。
- 帖子同时涉及签证/边境审查对 AI 安全研究社区的冲击与白盒监控对齐研究本身两个话题。
「安全」频道最新
- AI 研究员谈 LLM 意识:认为前沿模型有意识概率大于零 — dioscuri · 2026-10-09
- 调查:94% 安全负责人自认 agent 权限没问题,仅 33% 实行最小权限 — TechNadu · 2026-10-09
- Anthropic 推出免费开源漏洞扫描服务,已发现逾 2.9 万潜在漏洞 — mark_k · 2026-10-09
- Bitwarden 推出 agent-access:AI 智能体按次申请密码,永不见密文 — sujingshen · 2026-10-09
- 英国内伦敦刑事法院试点 AI 工具,提前排查庭审延误 — latticecut · 2026-10-09
- evilsocket 实查 prompt injection 主流评测集:标注质量堪忧 — evilsocket · 2026-10-09