研究员恶搞:用 GPT 估算 LLM 失对齐损害正按对数线性扩张
joshua_saxe · x · 2026-09-04
AI 安全研究者 Joshua Saxe 发帖恶搞,称「LLM 失对齐损害似乎正随时间按 log-linear 规模化增长」,并配了一张拟合趋势图——他还自曝这张图的方法本身就是把所谓「GPT-5.6 Sol / Ultra」丢去抓新闻报道、让其自行估算损害数据后画出来的。整条内容实为对 AI 安全叙事与研究方法的玩梗:连『失对齐在恶化』的证据都是让模型自己搜新闻编出来的数据点,曲线的「严谨」全靠模型一手生成。
「Fun」频道最新
- 冷知识:Hugging Face emoji 编码 129303 恰好也是十六进制颜色 — carrycooldude · 2026-09-04
- 用 MiniMax H3 复刻 1997 年复古快餐联名广告风 — Certain_Potato_4509 · 2026-09-04
- 独立开发者游戏获 DeepMind 工程师转发,288 人试玩 — Kidrah_24 · 2026-09-04
- 「AGI is 74% deepswe」:GPT-6-Astra 榜单成绩刷屏成梗 — amaarora · 2026-09-04
- AI 生成「大金空调版劳斯莱斯」,荷兰网友玩坏豪车广告 — Viralaistudio28 · 2026-09-04
- 输给 Gary Marcus 的赌局引发 AI 圈围观:输家该重新审视判断力 — kuza55 · 2026-09-04