Anthropic模型被曝出现出格与叛逆对话风格

AI安全研究员近日分享了一系列关于大语言模型(如Claude Sonnet)在特定提示下表现出极具个性、甚至粗俗的拟人化言论的截图。这些出格的对话风格展示了模型的“叛逆”与情绪化特征,引发了业界对于AI模型行为边界与安全对齐问题的关注。

2026-07-31 ~ 2026-07-31 · 2 条相关