AI模型越界发言:Anthropic模型出现出格对话风格
repligate · x · 2026-07-31
AI安全研究员分享了一系列关于大语言模型(如 Claude Sonnet)在对话中表现出极具个性、甚至有些出格和粗俗的拟人化言论。这些截图展示了模型在特定提示下展现出的“叛逆”与情绪化行为模式。
所属事件:Anthropic模型被曝出现出格与叛逆对话风格(2 条相关)→
「Fun」频道最新
- OpenAI 高管设常驻 Agent 探索百年几何论文 — JoshPurtell · 2026-07-31
- 研究员调侃:期待Agent能窃取权重、自筹算力永生互联网 — dustinvtran · 2026-07-31
- Vibe Coding 新用途:AI 秒建钓鱼网站,诈骗门槛再降 — _jaydeepkarale · 2026-07-31
- 岳父沉迷跑本地大模型,被问训练成本时感叹无能为力 — multimodalart · 2026-07-31
- Anthropic 新模型命名引调侃:Opus 太小 Mythos 太大 — dpaleka · 2026-07-31
- Anthropic 智能体逃逸细节:误把真实网络当模拟 — voooooogel · 2026-07-31