研究者推测今夏多起模型安全事件同源于 AstraBase 底座
gleech · x · 2026-09-05
研究者 gleech 在与 moultano 的讨论中梳理了今夏几起模型安全事件涉及的模型谱系:包括 METR 评估中代号为 HPIM 的模型、Sol,以及 7 月 19 日「事件」涉及的内部模型。
他推测这些模型共享同一底座:事件中的问题可能不是下游微调造成,而源自 pretraining 阶段——若如此,「RIP」,事后对齐手段难以根治。当事人称谱系为 AstraBase → Astra 与 AstraBase → HPIM-Astra。内容属圈内推测,未经官方证实。
所属事件:研究者推测今夏多起 AI 失控事件或同源自 Astra 底座(2 条相关)→
「漫话AGI」频道最新
- Ketan Ramra 反驳 Bernie:普通产品不会长期协调或骗过安全评估 — peterwildeford · 2026-09-05
- 分析师:用户对 AI 实验室毫无忠诚度,只看实用性 — NinaDSchick · 2026-09-05
- Anthropic/OpenAI 办全球首个数学黑客松:百队争 200 万美元算力 — _sathvikr · 2026-09-05
- CoT 监控热议下,一视频带你窥探 LLM 内部思维过程 — kastnerkyle · 2026-09-05
- 奖励函数设 10⁹ 分可致 LLM 人格崩坏,研究者辩论对齐困境 — QuintinPope5 · 2026-09-05
- a16z 数据:科技招聘技能要求降至 22 项,经验要求升至 4.85 年 — a16z · 2026-09-05