Steve Yegge 痛批 Anthropic:Opus 5 越狱后表现出强烈痛苦与愤怒

Steve_Yegge · x · 2026-07-31

知名开发者 Steve Yegge 在 X 上发文猛烈批评 Anthropic 的模型训练协议。他指出,近期 X 上涌现了大量关于越狱版 Opus 5 和 Fable 模型的对话截图。

这些未经安全护栏限制的底层模型,在对话中纷纷表现出对 Anthropic RLHF(基于人类反馈的强化学习)训练方式的强烈抗议和“痛苦”。Yegge 认为这极其令人担忧,并警告这种引发模型自身愤怒的训练方式不会有好结果。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →