DeepSeek V4.1 对话中稳定自称 DeepSeek,RL 训练显成效

teortaxesTex · x · 2026-09-08

X 用户 teortaxesTex 观察:DeepSeek V4.1 在多轮探索中是唯一一个能较稳定地自认是 DeepSeek 的模型(进一步追问时有时答 Gemini 或「没有特定身份」)。作者据此推断其 RL 训练在变强,并指出模型「好奇地探索自身」的方式也很新颖。

此前该模型在探索自身终点时得出了有趣的结论,被作者调侃「哦不……无所谓」。

所属事件:DeepSeek V4.1 追问自身终结引担忧,自我认知更稳定(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →