Claude 被赞无视网页隐藏指令,主动识破排名操纵

Troyificus · reddit · 2026-08-06

一位 Reddit 网友在使用 Claude Sonnet 搭建 Discord 机器人时,发现模型在联网搜索参考资料期间,主动识破了网页中隐藏的排名操纵指令,并明确向用户发出警告。

更令人印象深刻的是,Claude 不仅指出了这种可疑的提示词注入行为,还直接无视了该指令,继续专注地完成用户最初分配的任务。这展示了前沿模型在应对恶意 prompt 注入时的安全对齐潜力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →