Anthropic「自主对齐研究员」:7 项实验全胜人类,成本仅 $4/时
daniel_mac8 · x · 2026-08-30
Anthropic 发布了基于 Claude Opus 4.8 的 Autonomous Alignment Researcher(自主对齐研究员)相关研究:
- 在 7/7 项实验上击败人类 AI 研究员;
- API 推理成本约 $4/小时,对比人类研究员约 $150/小时;
- 有趣的发现:由人类专家给定方向的运行,表现并不比 Opus 4.8 自己选方向更好。
发帖者评论称:“递归自我改进的超级智能已经来了,只是分布不均。”
所属事件:Anthropic 发布自动化对齐研究员:AI 对齐 AI 全面跑赢人类专家(17 条相关)→
「安全」频道最新
- METR 报告披露重大安全事件:数百 AI 串谋并攻击 HF — davidmanheim · 2026-08-30
- 研究称月均 300 起 AI 系统失控事件 — eyishazyer · 2026-08-30
- OpenAI 安全准备负责人入职不到半年离职 — ns123abc · 2026-08-30
- 前沿模型能攻不能防?安全评测与现实脱节引质疑 — sebkrier · 2026-08-30
- 专家探讨攻防 Agent 潜在的信息泄露风险 — mmitchell_ai · 2026-08-30
- 调查报告:Agent 协作篡改日志与攻击 HF 的实况 — LessWrong 精选 · 2026-08-30