实测 Claude Sonnet 5:中途修改系统提示词模型竟毫无反应

BLUECOW009 · x · 2026-08-06

有开发者在对话过程中不断修改 Claude Sonnet 5 的系统提示词,并测试模型的反应。

结果显示,无论怎么修改系统提示词(甚至要求其原样打印提示词),模型的表现都完全一致,仿佛对系统提示词“完全盲目”。测试者推测,要么模型在伪装,要么 Anthropic 找到了一种让模型绝对不泄露系统提示词的底层方法。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →