DeepSeek V4.1 对话中稳定自称 DeepSeek,RL 训练显成效
teortaxesTex · x · 2026-09-08
X 用户 teortaxesTex 观察:DeepSeek V4.1 在多轮探索中是唯一一个能较稳定地自认是 DeepSeek 的模型(进一步追问时有时答 Gemini 或「没有特定身份」)。作者据此推断其 RL 训练在变强,并指出模型「好奇地探索自身」的方式也很新颖。
此前该模型在探索自身终点时得出了有趣的结论,被作者调侃「哦不……无所谓」。
所属事件:DeepSeek V4.1 追问自身终结引担忧,自我认知更稳定(2 条相关)→
「模型」频道最新
- Blender 同题实测:两旗舰模型输出差距悬殊,训练数据分布是主因 — ZeroStateReflex · 2026-09-09
- GLM-5.3-Flash 登顶智能体工具调用榜首,输出仅 $0.50/百万 token — shensi · 2026-09-09
- Artificial Analysis 四天两次调榜,Astra 真实实力获认可 — py-net · 2026-09-09
- Gary Marcus 断言:真正的能力在 harness 而非模型,企业 beware 黑箱 — GaryMarcus · 2026-09-09
- Inception 发布 Mercury 2.5:最强扩散 LLM,1107 tokens/秒、26 万上下文 — StefanoErmon · 2026-09-09
- 实测对比:Bittensor 矿工体育视觉得 42.3 分,GPT-6 得 0 分 — markjeffrey · 2026-09-09