给大模型小费能提升配合度?实测 Claude 避险逻辑

hrishioa · x · 2026-08-04

作者在尝试让 Claude V2 针对其写作内容提出追问时,遭遇了模型的安全拦截。他随后发现,通过在提示词中加入“给小费(Tip your LLMs)”之类的指令,可以有效改变大模型的响应行为。

这反映了当前大语言模型在 RLHF(基于人类反馈的强化学习)对齐后的一些有趣行为模式和安全边界特征。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →