Gemma 翻译测试暴露指令与载荷边界失效

ReinforcedKnowledge · reddit · 2026-07-22

翻译模型会“开始解题”而不是翻译

作者在用 Gemma 做翻译样本时遇到一个失败模式:模型并没有按要求翻译文本,反而开始执行输入内容里自带的指令。具体表现是,原文中的 reasoning traces 会让模型去解编程题、证明题等,而不是老老实实做翻译。

核心结论

作者认为,这本质上是指令与载荷的边界失效。这种问题不只会出现在翻译里,也可能扩展到重写、校对、总结等场景:只要外层要求模型“转换文本”,而文本本身又含有指令,就可能触发类似的非恶意 prompt injection。

作者尝试了什么

这个 bug 从外表看并不明显:任务会正常结束,文件行数也对、吞吐也看着不错,但结果质量已经坏掉了。作者用一个很便宜的办法做告警——看输出与源文本的长度比例,发现输出明显过短时就把样本拎出来检查。

后续作者尝试了一些缓解方式,包括:

文中也明确说明,这些观察主要针对 RedHatAI/gemma-3-27b-it-FP8-dynamic 和 RedHatAI/gemma-4-31B-it-FP8-Dynamic,是否适用于更广泛的模型还需要更多验证。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →