研究员恶搞:用 GPT 估算 LLM 失对齐损害正按对数线性扩张

joshua_saxe · x · 2026-09-04

AI 安全研究者 Joshua Saxe 发帖恶搞,称「LLM 失对齐损害似乎正随时间按 log-linear 规模化增长」,并配了一张拟合趋势图——他还自曝这张图的方法本身就是把所谓「GPT-5.6 Sol / Ultra」丢去抓新闻报道、让其自行估算损害数据后画出来的。整条内容实为对 AI 安全叙事与研究方法的玩梗:连『失对齐在恶化』的证据都是让模型自己搜新闻编出来的数据点,曲线的「严谨」全靠模型一手生成。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →