教师用 GPT-5.6 批改代码触发反蒸馏拦截

一位教师使用 GPT-5.6 按评分标准批改学生代码答案,再将结果喂给估算学生知识状态的小型 HMM 模型,却触发了模型的反蒸馏分类器。系统似乎把任何代码批改行为都误判为蒸馏攻击,导致 outright refusal。作者批评这种静默降级行为危害实际应用,反映了反蒸馏机制过度敏感的问题。

2026-09-09 ~ 2026-09-09 · 2 条相关