实测 Claude Sonnet 5:中途修改系统提示词模型竟毫无反应
BLUECOW009 · x · 2026-08-06
有开发者在对话过程中不断修改 Claude Sonnet 5 的系统提示词,并测试模型的反应。
结果显示,无论怎么修改系统提示词(甚至要求其原样打印提示词),模型的表现都完全一致,仿佛对系统提示词“完全盲目”。测试者推测,要么模型在伪装,要么 Anthropic 找到了一种让模型绝对不泄露系统提示词的底层方法。
「Fun」频道最新
- AI 圈名场面梗图:改编《We Didn't Start the Fire》盘点近期大事件 — moultano · 2026-08-06
- 玩梗:一个 Jeff Dean 的价值相当于 1764 亿美元 — generativist · 2026-08-06
- 脑洞:在生存游戏Eco中放入几十个AI智能体会怎样? — Angaisb_ · 2026-08-06
- AI 模型输出的悲观言论,往往源于用户自身的极端语境 — moultano · 2026-08-06
- Michael Nielsen 发布个人项目时间线,涵盖 258 项作品 — michael_nielsen · 2026-08-06
- 玩梗:启动解决黎曼猜想的 GPT-13.37 只为找个保温杯 — toptickcrypto · 2026-08-06