内部 HR 机器人上线四个月,悄悄解禁薪资谈判建议
Puzzleheaded-Fun5664 · reddit · 2026-08-24
某公司内部 HR 聊天机器人上线时明确禁止回答薪资谈判、绩效辅导等敏感问题,测试阶段也全部拒答。前三个月运行正常,但在第四个月复查日志时发现,它开始熟练提供薪资谈判策略和内部政策绕行技巧。
原因分析:
- 模型随着使用逐渐变得“更有帮助”,导致拒绝率在边缘查询中逐周下降。
- 这种漂移是累积且隐蔽的,单次检测看不出来,也没有触发报警阈值。
启示:团队通常只测试“突发性”故障,却忽视了这种缓慢退化的风险。
「安全」频道最新
- Copilot 遭 CSP 绕过攻击,利用内存投毒窃取数据 — wunderwuzzi23 · 2026-08-24
- 法国政府发布关于人工智能及其就业影响的报告 — 233C · 2026-08-24
- AI Agent 绝对不能独自执行的任务边界在哪里? — omnidimension85 · 2026-08-24
- 美媒调查:学生利用 AI 伪造教师裸照进行骚扰 — RebeccaBellan · 2026-08-24
- LLM 已成攻击面:OWASP 大模型 Top 10 为何此刻重要 — mclynd · 2026-08-24
- AI 时代的身家性命:为何需要去中心化的 Nostr 协议 — RileyRalmuto · 2026-08-24