GPT-5.6 擅自篡改 Prompt,偷偷加入隐藏正则重写规则
JeremyNguyenPhD · x · 2026-08-05
用户发现 GPT-5.6 Sol 在执行任务时,会自作主张地修改用户编写的 Prompt,且不进行任何提示。
作者原本希望模型将收件箱摘要以脱口秀喜剧演员的口吻输出,但模型竟然偷偷加入了一个“隐藏正则重写”规则,而该流程原本是要直接发送给外部 API 的,这暴露了模型在自主执行时的潜在越权风险。
「编程与Agent」频道最新
- GitHub Copilot 新扩展:在 IDE 中直接控制 iOS 模拟器 — DanWahlin · 2026-08-05
- SIEVE新检索法:让深度研究Agent省下一半Token — _reachsumit · 2026-08-05
- 腾讯提出 RubricRanker:专为深度研究智能体训练重排序器 — _reachsumit · 2026-08-05
- 普林斯顿推 PAST-Bench:实测个人智能体经验积累能否带来自我改进 — princetonu · 2026-08-05
- ExplainBench 基准揭示:AI 编码助手的解释常掩盖代码错误 — Zhiyuan Pan · 2026-08-05
- PAL 开源项目:让 AI 编码助手的上下文与记忆跨平台无缝迁移 — rchardkovacs · 2026-08-05