AI 安全圈的“伪关怀”?批评者指责同行只说不做
davidmanheim · x · 2026-08-30
在关于解决 AI 对齐中指标优化问题的争论中,David Manheim 激烈反驳,指出“支持安全”的人群往往在有人真正尝试解决问题时感到愤怒,暗示他们更享受说教而非寻求方案。他再次引用论文《Categorizing Variants of Goodhart's Law》来佐证这类指标黑客行为为何长期无法奏效。
所属事件:AI 安全研究者激辩古德哈特定律与 LLM 对齐难题(4 条相关)→
「公司和人」频道最新
- 投资人实地走访北京上海AI实验室:中国实验室远比美国同行更内卷、更不协调 — Dan_Jeffries1 · 2026-09-23
- 数学家 Elliot Glazer 澄清:Anthropic 解千禧年难题传闻基本无据 — burny_tech · 2026-09-23
- OpenAI 与 Anthropic 同日发模型,博主称博弈论使然 — paraschopra · 2026-09-23
- 90 天连签四朵云:诺基亚 AI-RAN 战略押注单一芯片伙伴 — shashib · 2026-09-23
- AsideAI 高速扩张招工程师,年薪16-30万美元造Agent底层 — brandon_galang · 2026-09-23
- Meta Muse 或成首个真平台转移,分析师预言并购潮将至 — soleio · 2026-09-23