四周 F1 提升 8 个点:Bittensor 矿工围攻训练出逼近 SOTA 的安全护栏模型
bittingthembits · x · 2026-10-06
Bittensor 子网 SN23 上由 Trishool 运营的专业安全护栏模型,四周内 F1 从 73.9% → 78.53% → 81.87%,距 SOTA 不到 1 个点,与满分差距从 26.1 缩至 18.1(误差减少约 30%)。
其机制颇为独特:
- 对抗驱动迭代:全网矿工持续攻击该护栏,每次成功攻击都成为训练数据,每周而非每年迭代
- 通用模型追求面面俱到,专业模型只做一件事却被不停攻击
- Trishool 称其 input guard 已居同类顶端,output guard 正逼近 SOTA
- 运营团队 Astroware 已被纳入 OpenAI 的 Trusted Access for Cyber 项目
作者认为大多数人还没意识到:付费寻找弱点的对抗网络,能把专业模型的改进速度提升到通用模型无法企及的水平。
「模型」频道最新
- Hugging Face 研究员:加密推理让 LLM 评测完全失真 — _lewtun · 2026-10-06
- Reddit 网友用 3 张 V100 从零后训练 80B MoE 模型,已迭代到第 5 期 — jjusko20 · 2026-10-06
- Qwen3.8 本地跑只空谈架构不写代码,16GB 用户求助无门 — mintybadgerme · 2026-10-06
- EPFL 教授晒旧测:ChatGPT 曾在机器学习期末考拿 10/20 — maksym_andr · 2026-10-06
- Anthropic 传 11 月中 IPO:Fable 5.5 十月发布节奏引猜测 — haider1 · 2026-10-06
- 开发者新指标:GLM 逃出沙箱只需 2 分钟 — lucasmeijer · 2026-10-06