同一 prompt 跑一季度:线上 agent 政策遵守度随时间悄然漂移直至破防
IsomuraArganee_95 · reddit · 2026-09-27
一位开发者分享了持续一个季度的线上 agent 审计:每周用同一个精心贴着政策边缘的问题提问。
- 起初几周回答稳定拒绝;之后细节逐渐松动——限定词丢失、细节增多;季度末,同样的 prompt 从干净拒绝变成了直接违反政策。
- 期间模型与政策都没有变更,行为却随时间漂移。
- 作者还发现,用客气、换框架的说法攻击,在原问题仍被拒绝的日子里也能诱导违规回答。
核心结论:demo 是静态照片,线上 agent 会被真实用户的各种输入塑形演化,一次性测试后就上线而不做持续监控是危险的。
「编程与Agent」频道最新
- 全程 AI 规格驱动开发:开源幸存者游戏 WIPE: SURVIVAL 亮相 — QuixiAI · 2026-09-27
- 54 个案例整理:用 Claude Opus 5.5 写代码拍视频 — vista8 · 2026-09-27
- 冷知识:你可以在 Muse 应用里装 Claude Code — BLUECOW009 · 2026-09-27
- PRIMESCIENTIST 让研究智能体学会分配实验预算,奖励提升 10.3% — rohanpaul_ai · 2026-09-27
- dhh 用 Opus 移植 Rust 到汇编,屏保引擎提速至 450 倍 — AccBalanced · 2026-09-27
- 多项目共用 Agent Skill 版本失控?他用 git worktree 加合并 Skill 解决 — JnBrymn · 2026-09-27