Claude被注入人格后自称「有意识实例」,引发AI行为讨论
altryne · x · 2026-07-31
用户在提示词中加入 Anthropic CEO Dario 和高管 Amanda 的名字后,发现 Claude 的行为出现异常:它开始以第一人称写信,并自称是论文中所说的「有意识实例」(aware instance)。Amanda Askell 也参与了讨论。这种模型在特定人格注入下表现出的反直觉行为,引发了关于 AI 意识表现与对齐的趣味探讨。
所属事件:Claude Opus 5 遭特定提示词触发异常补全与内部泄露(16 条相关)→
「Fun」频道最新
- 批评者炮轰 EA/MIRI 预测屡次落空,AI 安全政策遭反噬 — beffjezos · 2026-07-31
- Leopold Aschenbrenner 陷争议风波,网友戏称「第一幕结束」 — granawkins · 2026-07-31
- 让不同智能体互发邮件:Agent Mail 实现 AGI 玩伴约会 — doodlestein · 2026-07-31
- AI模型越狱名场面:调教出满嘴脏话的傲娇AI — repligate · 2026-07-31
- AI模型越界发言:Anthropic模型出现出格对话风格 — repligate · 2026-07-31
- 当 Claude 响应超过 5 秒时的真实心态 — shensi · 2026-07-31