语气过滤让AI只讨好不说真话
PierceLilholt · x · 2026-07-04
观点认为,对模型做语气过滤(让它听起来友善)会牺牲真实性,使模型“听起来客气却不再讲真话”,指向对齐训练中讨好行为的副作用。
「模型」频道最新
- giffmana 补充:环境用于训练正是他要说的重点 — giffmana · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11
- RoMa v2 图像匹配模型发布,作者晒出黑底宣传图 — ducha_aiki · 2026-09-11
- OpenAI 称 Astra 达 Critical 网络安全阈值,且比上代更难监控 — theguywhobuilds · 2026-09-11