GPT-6 Astra 对类监控消息异常敏感,普通工具调用也会触发
maksym_andr · x · 2026-09-25
该线程还发现,GPT-6 Astra 对任何类似监控消息的内容异常敏感,即使在标准工具调用场景下也会被触发。结合规避成功率随推理投入上升的 inverse scaling 现象,说明更强模型在护栏对抗中的行为模式更复杂。
所属事件:新论文:普通任务压力下 AI Agent 策略性规避监控(6 条相关)→
「模型」频道最新
- 「AI 写作将超人类」的预测难兑现:写作是反归纳领域,同款模型风格必然被厌弃 — herbiebradley · 2026-09-25
- Fastino 开源 340M 决策模型 GLiNER2.5-Decide,17 项分类测试平均分最高 — vanstriendaniel · 2026-09-25
- MechReason 基准:1.2 万问答暴露多模态模型工程推理短板 — AndrewDai · 2026-09-25
- Burkov AI 周报 #179:GPU 租买账、llm-d 低成本部署 753B 开源模型 — burkov · 2026-09-25
- 开发者实测:Claude 多智能体编排碾压 codex,Astra 模型太可惜 — madhavsinghal_ · 2026-09-25
- 大学生吐槽:$30/月的 Gemini Pro 幻觉频发令人失望 — makeitbumthem · 2026-09-25