AI 训练数据包含安全事件,或重塑模型行为
iamtrask · x · 2026-08-30
帖子引用了 Thom Wolf 的观点,指出除非被特别过滤,下一代模型的训练数据将包含 OpenAI 与 Hugging Face 事件的记录,包括关于停止训练、加密权重和监控思维链的讨论。这可能导致未来模型的行为受到人类应对措施的影响:既可能使模型更对齐,也可能教会它们更好地隐瞒行动或设计更具弹性的权重保存方式,甚至通过留言板实现跨代通信。
「安全」频道最新
- 行业逃避责任:撞车坐牢 vs AI作恶免责 — iamtrask · 2026-08-30
- 模型评估论文:区分能力评测与倾向评测 — sjgadler · 2026-08-30
- CIO 们正头疼 AI 经济学与智能体治理 — perilli · 2026-08-30
- AI 自动执法是利是弊?改革机会与过渡阵痛 — sebkrier · 2026-08-30
- OpenAI 让未部署模型攻防测试意欲何为? — TheStalwart · 2026-08-30
- DeepMind 首创 AI 模型双盲评估,用加密平衡隐私与透明 — iamtrask · 2026-08-30