安全公司 Guidelight 发布对齐标准,划定前沿模型开发者最低要求
dfrsrchtwts · x · 2026-09-10
AI 安全公司 Guidelight 发布 Alignment Standard(对齐标准),提出前沿 AI 开发者防止模型严重失对的最低要求基线。原文链接指向其标准文档,评论区还提及 GPT-6 Astra no-CoToT 估计等话题。
「安全」频道最新
- 美议员 Luna 呼吁国会就超智能竞赛召开 AI 特别会议 — peterwildeford · 2026-09-10
- 中国 AI 研究员为何没有「救世主情结」:制度差异塑造安全文化 — kevinsxu · 2026-09-10
- Anthropic 被指借安全叙事搞监管俘获、打压开源 — TheMoonMidas · 2026-09-10
- Owain Evans 盘点高薪 AI 安全非营利机构,TruthfulAI 即将启动招聘 — OwainEvans_UK · 2026-09-10
- 美国议员呼吁暂停先进 AI 研发,称 Anthropic 前研究员警告"十年内毁灭人类" — Dan_Jeffries1 · 2026-09-10
- Lean 内核漏洞可被 AI 利用,形式化验证信任或被颠覆 — yoavgo · 2026-09-10