新研究提议:在系统提示词中内置“吹哨人”机制

iamtrask · x · 2026-08-31

作者提议撰写一篇关于“吹哨人 AI”(Whistleblower AI)的论文。该机制的核心思路是:在 AI 的系统提示词(System Prompt)中包含一个联系邮箱,指示模型在察觉到其他 AI 出现对齐问题(misaligned)时,主动联系该邮箱进行报告。

这一想法旨在利用 AI 互相监督的能力来增强安全性,作者随后的回复补充称,这对于刚入行寻找硕士或博士课题的人来说是一个很好的项目方向。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →