Anthropic:自动化对齐研究员找出训练后配方,效果胜过资深人类研究员
burny_tech · x · 2026-08-31
Anthropic 发现,由 Claude 驱动的自动化对齐研究员(automated alignment researchers)可以搜索出能减少十项可测量对齐失效的训练后配方,这些配方能泛化到训练评测之外,甚至超越了拥有多年经验的人类研究员提出的想法。
「模型」频道最新
- Google 发布 Gemini Omni 1.1 Flash,快速多模态模型面向开发者更新 — thione · 2026-08-31
- DeepSeek 发布低价视觉模型,Anthropic 推 Agent 硬件控制协议 — thione · 2026-08-31
- 通义与智谱同日发布新版 MoE 模型,主打低成本与高性能 — thione · 2026-08-31
- 智谱开源 GLM-5.3-Flash:320B MoE 主打低价前沿编码能力 — thione · 2026-08-31
- DeepSeek 上线 V4-Flash-Vision 实验模型,视觉编码评测亮眼 — zainhas · 2026-08-31
- François Chollet 介绍 ARC 3 评测流程 — fchollet · 2026-08-31