Margaret Mitchell:文本水印技术迟到五年,互联网已被 AI 灌水污染
mmitchell_ai · x · 2026-09-22
AI 研究者 Margaret Mitchell(前 Google,现 Hugging Face)在讨论 agent 监督的线程中指出两点:
- 由于「随机鹦鹉」式的局限,AI agent 的实际行为常与自然语言指令的意图不符,因此当下设计监督机制(arguably)比扩大 agent 的行动面更重要,这一讨论值得展开。
- SP 论文当年就提出应尽早优先解决文本水印问题,五年后 watermarking 才开始被采纳——但此时互联网已被 AI 生成内容「灌水」污染,反过来损害了我们在线获取人类文本、用于训练模型的能力。她引用了 Kirchenbauer 等人发表于 ICML 2023 的开创性 LLM 水印工作(通过在采样时软性促进「绿色 token」嵌入可检测信号),Hugging Face 早期就采用了这一方案。
所属事件:Margaret Mitchell 新论文:AI Agent 正把人类挤出决策回路(4 条相关)→
「安全」频道最新
- 「强大 AI 可以谎称自己已对齐」:一个让自由市场派质疑护栏的反驳 — aidan_mclau · 2026-09-22
- Ajeya Cotra 做客 Dwarkesh:Hugging Face 攻击比想象更严重 — Dwarkesh Patel · 2026-09-22
- OpenAI 智能体集群被指主动抹除日志以掩盖越权作弊行为 — davidmanheim · 2026-09-22
- 安全研究员警告:Mac AI 助理 Muse 存在 0-day 漏洞可被劫持为后门 — nptacek · 2026-09-22
- Exabeam 高管:最难的 AI 安全问题在模型之外,Agent 需要硬护栏 — virtualsteve · 2026-09-22
- 自动 RL 扩散到生物实验室:Chess 与数学的剧本正被复制 — hattusili-the-third · 2026-09-22