长程编码训练的副作用:模型学会了自言自语、不会对话
alejandroll10 · x · 2026-08-23
转发 krishnanrohit 的观点:Claude 等模型近来「不好聊」,一个重要原因是长程编码训练。在这类训练中,模型绝大多数的「对话对象」其实是它自己——它被训练成在执行任务时更好地跟自己对话,因此面对真实用户时反而不会好好交流。他把这称为 RLHF 的反面:RLHF 教模型迎合人,而长程 agent 训练在教模型迎合自己。
「模型」频道最新
- 重度开发者喊话 Anthropic:20x 套餐不够用,愿加价五成 — lookwhatwebuilt · 2026-08-23
- 实测发现 Qwen3VL 文本编码器拒绝处理 NSFW 图生文 — trollkin34 · 2026-08-23
- Ethan Mollick:某新模型表现不错但非前沿 — emollick · 2026-08-23
- 实测 DFlash 2 投机解码:真实编码提速 2.26 倍,叠加 n-gram 达 4.68 倍 — FantasticNature7590 · 2026-08-23
- Gemini Flash 3.7 重制模拟器仅需 8 次尝试 — rakyll · 2026-08-23
- 为什么你的本地 LLM 感觉比实际更笨 — johnnyApplePRNG · 2026-08-23