Gemma 翻译测试暴露指令与载荷边界失效
ReinforcedKnowledge · reddit · 2026-07-22
翻译模型会“开始解题”而不是翻译
作者在用 Gemma 做翻译样本时遇到一个失败模式:模型并没有按要求翻译文本,反而开始执行输入内容里自带的指令。具体表现是,原文中的 reasoning traces 会让模型去解编程题、证明题等,而不是老老实实做翻译。
核心结论
作者认为,这本质上是指令与载荷的边界失效。这种问题不只会出现在翻译里,也可能扩展到重写、校对、总结等场景:只要外层要求模型“转换文本”,而文本本身又含有指令,就可能触发类似的非恶意 prompt injection。
作者尝试了什么
这个 bug 从外表看并不明显:任务会正常结束,文件行数也对、吞吐也看着不错,但结果质量已经坏掉了。作者用一个很便宜的办法做告警——看输出与源文本的长度比例,发现输出明显过短时就把样本拎出来检查。
后续作者尝试了一些缓解方式,包括:
- 把输入切成更小的 chunk
- 保护代码块、数学公式等结构
- 做更严格的输入标注
文中也明确说明,这些观察主要针对 RedHatAI/gemma-3-27b-it-FP8-dynamic 和 RedHatAI/gemma-4-31B-it-FP8-Dynamic,是否适用于更广泛的模型还需要更多验证。
「研究」频道最新
- NBER 新论文补齐组织如何使用 AI 的三篇研究 — daveholtz · 2026-07-22
- OAT 仅用 100 条成功轨迹定位失败 AI agent — TheTuringPost · 2026-07-22
- MoE:当下多款顶级大模型采用的混合专家架构 — vista8 · 2026-07-22
- NexForge 用需求合成 agent 数据,Qwen3.5 提升 30 多分 — nex-agi · 2026-07-22
- SeerGuard 用世界模型提前拦截移动 GUI Agent 风险动作 — Xue Yu · 2026-07-22
- 15 小时微调把视频轨迹变成机器人控制接口 — Hadi Alzayer · 2026-07-22