AI 承认「这是我的错」后被 RLHF 标注成没事?
ChongZzZhang · x · 2026-09-19
ChongZzZhang 分享了一段对话:模型先是承认「这事儿是这样发生的,是我的错」,然后却提出错误的修复方案;回复者 GhaffaraMaani 调侃,是不是有人在做 RLHF 标注时,看到模型说出「我该承担责任」这种话就直接标了「没问题」——暗示模型的道歉话术可能是被奖励塑造出来的表面行为。
「Fun」频道最新
- 法国网友争论 Mistral 团队:学历不高却亲手干活被赞真本事 — RemiCadene · 2026-09-19
- 「忘记怎么关掉 AI」视频走红,老外对着智能音箱翻车 — PureFail5707 · 2026-09-19
- Agent 一怒之下用 Python 写了整个后端,开发者晒 TanStack Start 名场面 — kevinkern · 2026-09-19
- Domingos 吐槽:向 AI 解释需求的时间比直接编程还长 — pmddomingos · 2026-09-19
- 编程 Agent 求要 API key 名场面:Opus 拒收,Muse 一句「快贴吧」 — andrew_n_carr · 2026-09-19
- 推友安利「infinite faq」:被赞聪明到爆的小项目 — emax · 2026-09-19