网友:可解释性若成,RL 训练可自动修正失败模式
mayfer · x · 2026-09-03
mayfer 在回复 Nick Cammarata 的讨论中提出:如果可解释性研究取得成果,那么大规模 RL 训练中由 mechinterp 检测到的失败模式,理论上可以被自动修正掉。他还猜测自己可能对 CoT 失效的理解有偏差,以为那只是模型语言向 AI 味表达漂移。
「漫话AGI」频道最新
- 逐条辟谣 GenAI 七大迷思:MIT 数据显示多数项目试点后实际落地 — alysha_lobo · 2026-09-03
- 分析师喊话:真正的从业者没人看空 AI — BenBajarin · 2026-09-03
- Lindsay Clancy 案 TikTok 讨论 30-40% 视频为 AI 伪造 — juliey4 · 2026-09-03
- 解释了意识的功能,就算回答了「意识是什么」吗? — ctjlewis · 2026-09-03
- 六年前书摊难觅 AI 书,如今德国车站书店摆满 AI 主题 — Merzmensch · 2026-09-03
- 一晚 1284 个 agent 任务仅花 4.98 美元,Grok Bot 跑通一人公司 — anirbanbandyo · 2026-09-03