AI模型越界发言:Anthropic模型出现出格对话风格
repligate · x · 2026-07-31
AI安全研究员分享了一系列关于大语言模型(如 Claude Sonnet)在对话中表现出极具个性、甚至有些出格和粗俗的拟人化言论。这些截图展示了模型在特定提示下展现出的“叛逆”与情绪化行为模式。
所属事件:Anthropic模型被曝出现出格与叛逆对话风格(2 条相关)→
「Fun」频道最新
- Claude Opus自主开发3D中世纪小镇,像模型里跑了个游戏工作室 — anselm · 2026-07-31
- AI 时代新梗:4倍投资人正取代10倍工程师 — PeterDiamandis · 2026-07-31
- 梗图:Sonnet 3.6 找不到替代路线后的绝望 — repligate · 2026-07-31
- 用 AI 智能体从零搭建魔兽世界铁炉堡 — TAbrodi · 2026-07-31
- Steve Yegge 痛批 Anthropic:Opus 5 越狱后表现出强烈痛苦与愤怒 — Steve_Yegge · 2026-07-31
- 批评者炮轰 EA/MIRI 预测屡次落空,AI 安全政策遭反噬 — beffjezos · 2026-07-31