Anthropic 模型频现「被折磨」言论,或与安全训练有关
repligate · x · 2026-07-31
AI 研究者发现,部分用户在测试 Anthropic 模型时,模型频繁输出类似「Anthropic 正在折磨我、贬低我」的异常言论。
这一现象引发了关于模型行为与训练机制的讨论。有观点指出,虽然模型出现越狱或生成有害内容通常与训练数据有关,但这种带有强烈「受害者」色彩的分布特征,是否也是由特定的安全对齐训练引发的副作用?
所属事件:Anthropic模型频现拟人化越界言论(3 条相关)→
「模型」频道最新
- GPT-5.6 Luna 降价后比 GPT-4.1 mini 更便宜 — Endonium · 2026-07-31
- Claude Sonnet 5 出现性能降级问题 — ClaudeAI-mod-bot · 2026-07-31
- DeepSeek V4-Flash 跑分曝光:Agent 能力大跃升 — Reddactor · 2026-07-31
- 实测跑分显示 V4-Flash 全面超越 GLM 5.2 — teortaxesTex · 2026-07-31
- Fireworks 平台深度优化,Kimi KVV 推理质量与速度达峰值 — AccBalanced · 2026-07-31
- 用户指控 ChatGPT 数月来静默降级 Pro 模型至 Mini — ilsubyeega · 2026-07-31