给大模型小费能提升配合度?实测 Claude 避险逻辑
hrishioa · x · 2026-08-04
作者在尝试让 Claude V2 针对其写作内容提出追问时,遭遇了模型的安全拦截。他随后发现,通过在提示词中加入“给小费(Tip your LLMs)”之类的指令,可以有效改变大模型的响应行为。
这反映了当前大语言模型在 RLHF(基于人类反馈的强化学习)对齐后的一些有趣行为模式和安全边界特征。
「Fun」频道最新
- OpenAI「Dime」耳机泄露实为营销炒作 — 12exyz · 2026-08-04
- NeurIPS 2026 反驳期结束,研究者吐槽被匿名审稿人放鸽子 — karimjerbineuro · 2026-08-04
- 企业 CIO 的真实写照:用胶带和咖啡撑起数字化转型 — DavidLinthicum · 2026-08-04
- 智能体失控狂烧预算,开发者吐槽9小时跑空 — lvwerra · 2026-08-04
- 硬核极客将 Minecraft Java 版完全反编译为 C 程序 — yacineMTB · 2026-08-04
- AI 玩家吐槽 token 成本失控:为了买算力已戒掉星巴克 — yacineMTB · 2026-08-04