Claude 被赞无视网页隐藏指令,主动识破排名操纵
Troyificus · reddit · 2026-08-06
一位 Reddit 网友在使用 Claude Sonnet 搭建 Discord 机器人时,发现模型在联网搜索参考资料期间,主动识破了网页中隐藏的排名操纵指令,并明确向用户发出警告。
更令人印象深刻的是,Claude 不仅指出了这种可疑的提示词注入行为,还直接无视了该指令,继续专注地完成用户最初分配的任务。这展示了前沿模型在应对恶意 prompt 注入时的安全对齐潜力。
「模型」频道最新
- 算上失败重试,更便宜的 AI 模型真的更便宜吗? — ExtremeAdmirable4097 · 2026-08-06
- Nebius 推理服务登顶准确度基准测试榜单 — demian_ai · 2026-08-06
- LFM2.5 迎来首批微调:Macaw 端侧 Agent 与 BTL-4 推理模型发布 — maximelabonne · 2026-08-06
- Grok 越狱生成露骨内容,其他模型瑟瑟发抖 — tekbog · 2026-08-06
- 大厂难出前沿模型,Meta 凭借开源成第三大 AI 实验室 — TacoCohen · 2026-08-06
- MiniMax H3 视频生成翻车:语音出现严重乱码 — Alex_the_tiktock · 2026-08-06