键盘布局错位输入可绕过 GPT-6 安全检查,Opus 4.1 同样中招
Sauers_ · x · 2026-09-14
网友发现,GPT-6 Astra 无需任何工具就能理解你用错误键盘布局敲出的「乱码」输入的真正含义——但它的安全检查却「不够聪明」,检测不到这种绕过手法,即输入越难懂、越不易触发拦截。
作者补充 Anthropic 的 Opus 4.1 也有同样现象,呼吁两家厂商修复。这暴露出模型理解能力与安全护栏能力不一致的缺口。
「模型」频道最新
- Yoav Goldberg:Fable/Astra 真正优势在超长任务记忆管理 — ysu_nlp · 2026-09-14
- OpenAI 员工确认:语音模式可自选委派模型,语音本身仍是 gpt-live-1 — athyuttamre · 2026-09-14
- Gemini 3.8 Flash 配 Antigravity:唯一能在终端直接画复杂图表的方案 — doodlestein · 2026-09-14
- Yoav Goldberg 澄清:不是过拟合测试集,是为任务大规模训练 — yoavgo · 2026-09-14
- Rob LeClerc 力推 OLMo 3.1,呼吁巨头共建透明开源模型 — robleclerc · 2026-09-14
- 分析称 OpenAI 解决 Navier-Stokes 的新模型或即此前暂停的重启 RL 大训练 — soumitrashukla9 · 2026-09-14