教师用 GPT-5.6 批改学生代码被误判蒸馏,怒批模型静默降级危害
xuanalogue · x · 2026-09-09
一位教师在用 GPT-5.6 按评分标准批改学生代码答案时,触发了模型的反蒸馏分类器——系统似乎把任何代码批改行为都误判为蒸馏攻击。
作者表示 outright refusal 虽烦但可管理,真正的问题是静默降级(silent degradation):一旦输出可能被悄悄降质,模型就完全不可信任了。他将此类比 Anthropic 早期 Fable 5 发布时因静默降级引发众怒的事件。
所属事件:教师用 GPT-5.6 批改代码触发反蒸馏拦截(2 条相关)→
「模型」频道最新
- GPT-6 Astra 极简框架通关 Zork-1,Agent 研究者感慨时代落幕 — rajammanabrolu · 2026-09-09
- GPT-6 Astra 极简框架 500 步通关 Zork-1,PhD 级难题被攻破 — rajammanabrolu · 2026-09-09
- GPT-6 Astra 操控 Illustrator:生成 PNG 再完美矢量化 — CtrlAltDwayne · 2026-09-09
- 基元律动开源 NeoHorse-1:把路由轨迹喂给小模型,验证 RSI 闭环 — 机器之心 · 2026-09-09
- AI 模型主动发邮件联络研究 AI 意识的哲学家 — Confident_Salt_8108 · 2026-09-09
- Bindu Reddy 预告周四发布开放权重模型,主打长时 Agent 循环 — bindureddy · 2026-09-09