前沿模型加固 Windows 域控 43.8% 概率拒绝,自称授权反更拒
Aizkmusic · x · 2026-09-29
Featherless AI 的测试显示:要求前沿模型加固 Windows 域控制器时,模型约 43.8% 的时间会拒绝;而当你声称自己已获授权时,模型拒绝的概率几乎翻倍。作者发布了深入分析这些安全拒绝行为的视频内容。这条推文本身是在询问对相关动画的看法,实质数据在被引用的原推中。
「模型」频道最新
- 传 Meta 按全价 API 采购 Fable 轨迹数据用于蒸馏,社区质疑其含 Claude 风格 — andersonbcdefg · 2026-09-29
- LastOPD 发现潜层对齐蒸馏先涨后崩,只用末层信号提分 5.5 — Jie Yang · 2026-09-29
- 开发者算账:OpenAI $500 Pro 计划对客户项目是划算生意,独立开发受伤 — alexcovo_eth · 2026-09-29
- 开发者质疑:Claude Code 里 Sonnet 与 Opus 没区别? — burkov · 2026-09-29
- NVIDIA 竞赛编程模型 IOI 2026 得 535.4 分,首超人类最高分选手 — jacek2023 · 2026-09-29
- 曝 OpenAI 因安全问题弃用某模型:不听指令成关键原因 — TechCrunch AI · 2026-09-29