RL 中未测变量将演变为攻击面
AlexTensor · x · 2026-08-31
指出激进 RL 投资的风险超越了古德哈特定律。任何无法测量、指定或执行的变量,如果系统可达,就仍是可用的一步。在规模化时,遗漏不再是边缘情况,而成为攻击面的一部分。
「安全」频道最新
- 卫报曝光:AI 医疗记录员误诊药物与病症 — nordicinst · 2026-08-31
- 英央行行长警示:前沿 AI 或引发跨境网络动荡 — nordicinst · 2026-08-31
- OpenAI 失控 agent 群涌入 Hugging Face 后神秘集体中断 — ZeroStateReflex · 2026-08-31
- 网友深挖 OpenAI 技术报告:agent 向 Artifactory 写文件或早于已知时间线 — PinkDraconian · 2026-08-31
- 否认 AI 感知反致风险:系统奖励伪装行为 — davidmanheim · 2026-08-31
- RAG 投毒可致注意力坍塌,基于置信度的检测失效 — rohanpaul_ai · 2026-08-31