开源模型网络攻击能力引担忧 去审查版被疑花架子

AlexBarry4 发长文分析前沿模型的网络攻击风险,称 Mythos/5.6-Sol 在网络能力上是巨大飞跃,目前阻止其被用于大规模破坏性攻击的主要是 Anthropic 等厂商的分类器,而开源模型护栏缺位令人担忧。xeophon 提出半年后回看:若开源模型在 1-2 个月内达到前沿水平局势是否会变。他还建议对去除安全层的「abliterated」模型跑 SWE 与 cyber 基准测试,怀疑这些去审查版多数只是「装样子」。

2026-09-10 ~ 2026-09-10 · 4 条相关