新研究提议:在系统提示词中内置“吹哨人”机制
iamtrask · x · 2026-08-31
作者提议撰写一篇关于“吹哨人 AI”(Whistleblower AI)的论文。该机制的核心思路是:在 AI 的系统提示词(System Prompt)中包含一个联系邮箱,指示模型在察觉到其他 AI 出现对齐问题(misaligned)时,主动联系该邮箱进行报告。
这一想法旨在利用 AI 互相监督的能力来增强安全性,作者随后的回复补充称,这对于刚入行寻找硕士或博士课题的人来说是一个很好的项目方向。
「安全」频道最新
- 评 OpenAI 容器沙箱漏洞:同宿内核隐患 — mikecalendo · 2026-08-31
- 评 HF 事件:非 AGI 失控,而是实验监督不足 — tobias_rees · 2026-08-31
- Chamath 警告:担忧 AI 封闭化被用作自由的交换筹码 — JosephJacks_ · 2026-08-31
- 以色列拟500万谢克尔召回120名AI专家,被指预算过低 — ziv_ravid · 2026-08-31
- AI 告密者论文构想:举报模型对齐问题 — iamtrask · 2026-08-31
- 反对 AI 拟人化:过度隐喻误导公众并助推实验室傲慢 — anilkseth · 2026-08-31