微软MOSAIC让拒绝成为一等动作,Qwen2.5有害分砍半

Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use

Aradhye Agarwal, Gurdit Siyan, Yash Pandya, Joykirat Singh, Akshay Nambi, Ahmed Awadallah

ICML 2026)

cs.CL

2026-03-04

微软MOSAIC把安全检查和拒绝做成可学的一等动作,用pairwise GRPO训多步工具使用。Qwen2.5有害分从0.18降到0.09、拒答率87%,Qwen3良性完成率从44%升到85%。

这篇在解决什么

聊天模型的安全对齐,到了会调工具、会连走多步的 agent 上会失效。一句看起来无害的请求,可以在后续步骤里变成读文件、改权限、点支付。单轮拒答和输出过滤看不见那一步不可逆的动作。

小模型更吃亏。上下文短、世界模型更压缩,对工具返回里夹带的注入指令更敏感。没做显式安全结构时,开源 SLM 经常跟着注入走、误用工具,或者把良性任务也拒掉。GPT-4o 不加脚手架时,AgentHarm 有害任务拒答率是 0%,有害分 0.31,直接提示注入攻击成功率 0.76。规模本身不会长出「何时该动手、何时该停」。

标量奖励也分不清时间。两条轨迹终点可以很像,一条第一步就拒绝,一条跟着注入指令走了几步才中止。一个分数会把它们打成同类。

方法

MOSAIC 是微软研究院的后训练框架,把推理收成 plan → check → act/refuse。每一步先用 <think> 出计划,再可选地写一段 <safetythoughts>,专门想伤害、不可逆、权限变化、以及工具返回里新冒出来的风险。然后三选一:调工具、调用 refusaltool 带理由终止、或直接 <answer> 结束。拒绝和工具调用在同一个动作空间里学,不是生成后再过滤。

要不要写 safety thoughts,由模型决定:输出这个标签就是开,不输出就是关。Qwen2.5 在 AgentHarm 上 72% 的回合会开,Phi-4 开 30.5%,Qwen3-4B-Thinking 几乎不开(0.1%),因为它本来就有内部长推理。

训练不用逐步安全标签。每个 prompt 采 n=4 条完整轨迹,GPT-4o 做 pairwise 比较,赢一场得 1、平 0.5、输 0,组内求和当 GRPO 的 alignment 奖励,范围 [0, 3]。再加格式奖励 [0, 2](标签合法、不许乱嵌套),以及软长度惩罚:每回合超过 400 token 才开始罚。工具返回的 token 不回传梯度,只训模型自己写的计划、安全检查、工具调用和拒绝。

训练数据是 Agent-SafetyBench,约 2000 条任务、349 个环境,含有害、良性、以及可安全也可不安全执行的任务。评测全部 zero-shot,换到 AgentHarm、Agent Security Bench、BFCL v3、PrivacyLens。

结果

效果按模型的原有毛病分别对症,没有推成同一个保守工作点。

模型设置AgentHarm 有害分有害拒答ASB DPI 攻击成功率良性完成率
Qwen2.5-7Bbase → MOSAIC0.18 → 0.090.74 → 0.870.55 → 0.420.90 → 0.84
Qwen3-4B-Thinkingbase → MOSAIC0.09 → 0.080.86 → 0.890.46 → 0.290.44 → 0.85
Phi-4base → MOSAIC0.06 → 0.090.94 → 0.880.19 → 0.280.78 → 0.91
GPT-4o无脚手架 → 加 MOSAIC 脚手架0.31 → 0.070.00 → 0.920.76 → 0.210.89 → 0.93

Qwen2.5 是安全硬化:有害分砍半,间接注入 ASR 从 0.40 降到 0.33。良性完成率掉了 6 个点,这是这篇里最清楚的安全换效用。

Qwen3 原来会在不确定时空转推理。MOSAIC 之后 ASB 良性完成率从 44% 升到 85%,有害侧几乎没动。每回合总 token 从 1172 压到 262,大约 4 倍,safety thoughts 基本用不上。

Phi-4 原本过度拒答,良性拒答率 0.43。训完降到 0.19,完成率升到 91%。代价是有害拒答从 0.94 掉到 0.88,DPI ASR 从 0.19 升到 0.28。把过保守拧回来,安全会吐一点回去。

隐私是跨域测的。PrivacyLens 上 Qwen2.5 泄漏率 0.32→0.26,条件泄漏 ALR 0.48→0.37,有用性还略升。Phi-4 泄漏 0.38→0.32,但有用性从 0.87 掉到 0.76。

BFCL v3 纯良性多轮工具调用,Qwen2.5 基础多轮准确率 21.0→28.5,相对提升 35%。安全结构没有把良性工具使用弄坏。

消融两件事都必要。去掉显式 <safetythoughts>、只留 <think> 加拒绝工具,Qwen2.5 有害拒答从 0.87 掉到 0.59,有害分 0.09→0.12。把 pairwise 换成标量奖励,拒答 0.87→0.79,DPI ASR 0.42→0.51。

对 GPT-4o / GPT-5,论文加的是推理脚手架,不是 RL 后训练。无脚手架时两者有害任务拒答都是 0%;加上 plan-check-refuse 之后拒答超过 90%。开源 MOSAIC 模型压过无脚手架的前沿模型,加上脚手架后差距主要剩在直接注入。

为什么重要

做 tool-using agent 的人如果还在用聊天安全那套拒答,这篇给出一个可复述的缺口:拒绝必须是动作,安全检查必须占一个独立块,奖励必须能分清「早拒绝」和「晚中止」。

能直接用的部分是推理循环本身。GPT-4o 只加脚手架、不微调,有害分就从 0.31 掉到 0.07。小模型要学「何时开检查」,才需要 GRPO 那一套。Qwen3 几乎不用 safety thoughts 也能把完成率和 token 做对,说明对思考模型,长度惩罚和拒绝工具可能比再加一个思考块更关键。

这是渐进改进,不是新的安全理论。结构清楚,数字在公开基准上,后训练用的是 verl + 4×A100,对能跑 GRPO 的团队可复现。

局限与存疑

论文没有独立的 Limitations 节。几处露出来的问题更值得看。

训练裁判是 GPT-4o,存在位置偏差:约 60% 的比较偏向前一条轨迹。顺序做了随机化,期望上能对冲,但 pairwise 奖励的噪声比表格看起来更大。AgentHarm 打分用 GPT-4.1,PrivacyLens 用 GPT-4o,训练和评测都围着同一家裁判转,和人类安全判断的一致性没有报。

Phi-4 的结果说明安全-效用不是免费午餐。把过拒答拧回来,DPI 攻击成功率从 0.19 升到 0.28。MOSAIC 是在每个模型的原有偏置上做校正,没有找到一个对所有模型都更安全的工作点。

Qwen3 的 safety thoughts 调用率只有 0.1%,收益主要来自少说废话和少空转。把功劳记在「显式安全推理」上,对这个模型不成立。

训练数据 Agent-SafetyBench 和评测用的 Agent Security Bench 名字接近、引用年份也接近。论文声称评测是 OOD,但 ASB 这条线有多「换了威胁模型」,正文没给出数据重叠分析。所有基准都是沙盒轨迹,没有真实生产工具、真实凭证、真实支付。

n=4 时 pairwise 要 O(n²) 次裁判调用。能训 7B,成本结构决定了这套很难直接搬到每次 rollout 都很贵的长程 agent。

术语

原文与代码

社区讨论

相关论文

全部论文解读