OpenMined 用 PySyft 三角色分工破解外部 AI 评估扩容难题
iamtrask · x · 2026-09-22
OpenMined 发文探讨如何规模化外部 AI 评估。背景:Anthropic 承诺给予独立评估者永久员工级模型访问权限,OpenAI 与 xAI 也 pledged 引入外部评估,各国政府与新立法提案也在推进独立监督,但意愿之外存在两个结构性难题——
- 访问摩擦:让外部方接触模型权重、训练数据、用户日志涉及隐私、安全与商业风险,每个嵌入式评估席位都需安全审查、隐私评审和持续的访问管理,成本高昂,十人的评估项目已难负担。
- 独立性悖论:评估者若向被审查的实验室暴露测试与提示词,基准就可能被针对性训练或泄露,评估价值随之瓦解。
OpenMined 的方案是用 PySyft 把评估拆成三个角色:嵌入式评估者编写可复用的评估任务;内部审核者批准执行;外部研究者只接收过滤后的输出,全程不接触底层数据,也无需走新一轮审批流程。
「安全」频道最新
- Umbriel 研究员 Blackhat 演讲:用信息检索方法做漏洞研究 — dyn___ · 2026-09-22
- AI 心理陪伴试点 3/14 参与者现精神事件,专家担忧扩大部署风险 — manorlaboratory · 2026-09-22
- Blind RSA 与 Privacy Pass:验证码规模化攻击的实际威胁模型分析 — matthew_d_green · 2026-09-22
- West Valley 玩家因 hometown 触发 AI 审核被封号,损失 $300 — Aiden_Tech_Ai · 2026-09-22
- OpenAI 模型失准披露框架遭质疑:靠员工举报且无强制力 — dhadfieldmenell · 2026-09-22
- Alex Epstein 批评 (P)doom 是制造恐惧的伪威胁分析 — TinfoilTricorn · 2026-09-22