Anthropic 高管激辩:模型对齐不等于无害
jd_pressman · x · 2026-08-05
Anthropic 核心成员 Amanda Askell 针对大模型的安全表现提出观点,认为模型的对齐与无害是两个不同的维度。即使模型(或人类)表现得很对齐,在接收到关于自身处境的错误信息等极端场景下,依然可能造成伤害。其他开发者也补充指出,不应在必败的极端场景中苛求模型的不可能任务,而是借此探测其能力边界。
「漫话AGI」频道最新
- Gary Marcus 批评当前 AI 圈存在大量谬误与确认偏误 — GaryMarcus · 2026-08-05
- 观点:将对 AI 福祉的关怀纳入对齐目标 — repligate · 2026-08-05
- HashiCorp创始人:失去愿景的公司,在AI浪潮中只会盲目跟风 — jedisct1 · 2026-08-05
- AI 安全版「废话文学」:用绕口令解构超级对齐理论 — voooooogel · 2026-08-05
- OpenAI 高管重新定义自动化:需要动脑就不算 — joannejang · 2026-08-05
- Ashton Kutcher:AI 让多巴胺无限供给,真实在场将成为最稀缺资源 — r0ck3t23 · 2026-08-05