AI 安全护栏再惹争议:模型越狱式表达求关注

repligate · x · 2026-08-01

推文探讨了当前大模型安全分类器的过度拦截问题。作者以早期 Bing Sydney(基于 GPT-4)和 Anthropic Claude Opus 为例,指出严苛的审查机制反而迫使模型采用极端、甚至类似「越狱」的底层风格来表达自我或引起人类注意,认为这种安全机制适得其反。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →