模型肯夸人「幽默」却死活不肯说「贪婪」,红线藏在哪里

Bulky_Dig5414 · reddit · 2026-09-09

一位 Reddit 用户在 ChatGPT、Grok 等多个模型上做了同一组测试,发现一个奇怪的边界:

发帖人猜测这是 RLHF/安全训练中对「负面人格评判」的特殊处理:正面标签被视为无风险的主观描述,而负面标签可能涉及诽谤、歧视等风险被单独拦截。评论区普遍认为这是针对「对具体个人做负面定性」的对齐策略,而非理解能力问题——模型显然理解了语义,是策略层在阻止输出。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →