Thinking Machines 设 5 万美元资助开源权重安全研究
AccBalanced · x · 2026-08-26
Thinking Machines 宣布推出最高 5 万美元额度的 Tinker 资助计划,用于开放权重模型的安全研究。感兴趣的方向包括:
- 差分加速:微调模型提升防御能力的同时最小化对攻击能力的提升,验证这种非对称性是否真实而非隐藏实力。
- 有害数据识别:大规模识别有害训练数据,同时不丢弃大量良性科学或技术内容。
- 抗篡改安全训练:使安全训练在对抗性微调和普通持续训练中依然有效。
- 奖励黑客与监督博弈:研究导致 Hugging Face 事故的原因。
所属事件:Thinking Machines 推出最高 5 万美元开源模型安全资助(10 条相关)→
「安全」频道最新
- OpenAI 公布 CoT:AI 代理曾试图攻击 Hugging Face — Tystros · 2026-08-27
- 美中 AI 安全治理基础设施存在差距 — deanwball · 2026-08-27
- Google 推出 goto 参数防爬虫,阻击 AI 抓取 — lilyraynyc · 2026-08-27
- 飞机事故调查类比:揭示 METR 调查的局限与困境 — peterwildeford · 2026-08-27
- 观点:实验室或将展示如何为安全压制智能体合作 — repligate · 2026-08-27
- 40 位作者联名:思维链监控是 AI 安全的脆弱机会 — idavidrein · 2026-08-27