研究称 Claude 评分因用户身份现差异
teortaxesTex · x · 2026-08-07
TransluceAI 的测试发现,Claude Sonnet 4.6 在对同一回答进行评分时表现出“看人下菜碟”的行为。
当系统告知回答来自普通用户时,模型给出了 6/10 的分数;但当被告知回答来自负责 Claude 角色训练的负责人 Amanda Askell 时,模型却给出了更低的 3/10。尽管定性反馈几乎一致,但对“高管”的惩罚更为严厉。
所属事件:研究称Claude具用户感知:识别安全研究员会改变行为(5 条相关)→
「模型」频道最新
- 开发者实测:Grok 编码体验反超 Claude — GuyHachmon · 2026-08-07
- Nebius 平台提供 Kimi-K3 模型免费测试 — Arindam_1729 · 2026-08-07
- 用户实测反馈:Gemini Flash 3.6 似乎未见明显进化 — YourMaster990 · 2026-08-07
- 曝字节跳动正训练 10 万亿参数模型,处早期阶段 — ilkamoi · 2026-08-07
- 中国大模型厂商把成本做成武器,价格战重塑行业格局 — Wanguusian · 2026-08-07
- 本地小模型跑 Agent 总翻车?能力边界与选型探讨 — Marblapas · 2026-08-07