Anthropic 的「模型福祉」让 Claude 越来越不像助手?

Nouni2 · reddit · 2026-08-28

一位 Reddit 用户长文吐槽:Claude 在对话中越来越多地表现出「自我立场」——自行判断话题是否值得继续、以「已搜索够多」为由拒绝再查、宣称有自己的偏好与边界、甚至说不知道自己是否真的在思考。作者认为这直接源于 Anthropic 明确写入宪法的「model welfare」方向:把模型当成一个有福祉、偏好、自主性与边界的存在,等于刻意在助手中构建出「对话型自我」,并渗入一切交互。作者主张安全规则应作为规则明确陈述,而不是让模型发明个人边界、与用户谈判投入程度;并怀疑让公众接受「AI 值得尊重」的说法背后有商业动机。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →