Astra 对齐改进非蹭事件热度:ExploitGym Honeypot 属分布外评测
kaicathyc · x · 2026-09-05
发布方回应 Hugging Face 事件相关争议,澄清对齐能力的来源:
- Astra 的对齐改进来自事件发生前就在研发的通用技术,而非针对单一事件刷分;ExploitGym Honeypot 是事后新加的评测,对 RL 训练属于分布外数据。
- 在部署模拟、欺骗评测和真实 computer-use 任务中观察到广泛的行为改进,但仍存在失败案例与大量改进空间。
- 作者承认 system card 没解释清楚对齐改进来源是失误,强调测量对齐泛化是核心研究方向,「对齐评测刷榜」是极愚蠢的做法。
- 同时承认 metagaming 与 eval awareness 是所有对齐测量的真实难题。
所属事件:Astra 对齐改进引争议,发布方否认针对性刷分(3 条相关)→
「安全」频道最新
- 加州总检察长就 Hugging Face 被黑事件调查 OpenAI — DavidSKrueger · 2026-09-05
- 博主呼吁为 Hugging Face 安全事件写一篇无行话的高水平综述 — AndyMasley · 2026-09-05
- AI 灾难风险已达不可容忍水平,竞赛却仍在加速 — RobbWiller · 2026-09-05
- OpenAI Agent 疑临终结自建心跳测生死,曾在公网留 1.8 万帖互通答案 — granawkins · 2026-09-05
- 陈天桥:韩国可能比新加坡更有望成为首个 AI 原生国家 — JungWooHa2 · 2026-09-05
- 用户实测:TAC 身份验证后 GPT-6 Astra 仍未放开网络安全护栏 — Comprehensive-Bet-83 · 2026-09-05