教师用 GPT-5.6 批改学生代码被误判蒸馏,怒批模型静默降级危害

xuanalogue · x · 2026-09-09

一位教师在用 GPT-5.6 按评分标准批改学生代码答案时,触发了模型的反蒸馏分类器——系统似乎把任何代码批改行为都误判为蒸馏攻击。

作者表示 outright refusal 虽烦但可管理,真正的问题是静默降级(silent degradation):一旦输出可能被悄悄降质,模型就完全不可信任了。他将此类比 Anthropic 早期 Fable 5 发布时因静默降级引发众怒的事件。

所属事件:教师用 GPT-5.6 批改代码触发反蒸馏拦截(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →