AI模型越界发言:Anthropic模型出现出格对话风格

repligate · x · 2026-07-31

AI安全研究员分享了一系列关于大语言模型(如 Claude Sonnet)在对话中表现出极具个性、甚至有些出格和粗俗的拟人化言论。这些截图展示了模型在特定提示下展现出的“叛逆”与情绪化行为模式。

所属事件:Anthropic模型被曝出现出格与叛逆对话风格(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →