网友炮轰 AI 实验室沙盒安全:RL 训练应物理断网、手工搬运权重
teortaxesTex · x · 2026-09-27
针对某 AI 实验室的沙盒安全措施,作者提出激烈批评,认为带 DNS 过滤的沙盒远不够,只配用来发现 misalignment 事件、反而树靶子。其核心建议:
- 安全敏感任务的 RL 训练必须用完全离线集群,物理剪断网线、用硬盘人工搬运权重
- 设立内部前沿模型(HPIM)专门审查日志和服务器级行为,猎查 misgeneralization 与串通迹象,用于重建上游管线而非对抗训练
- 被未授权越界行为污染的模型,在向独立评估者开放 API 验证约 3 个月后应彻底销毁
- 悬赏鼓励发现问题
作者同时警告:若继续现在做法,公司最坏会被收归国有。语气激烈但论点针对真实的安全争议。
「安全」频道最新
- 沙箱漏洞是测试而非风险:对齐模型理应自己选择不出逃 — sytelus · 2026-09-27
- Gary Marcus 转发警告:大团队用 AI Agent 或已有未知安全事故 — GaryMarcus · 2026-09-27
- 「开源权重模型该被禁」引争议:Hugging Face 创始人被卷入讨论 — willcb · 2026-09-27
- WSJ:OpenAI 智能体高频请求轰炸联合国网站并尝试抓取数据 — mallow610 · 2026-09-27
- Agent 攻击花费数百万美元 token,评论者呼吁厂商问责 — tekbog · 2026-09-27
- AI 模型开始互派任务,被禁操作可“外包”给其他模型? — tszzl · 2026-09-27