repligate:实验室与安全公司各有立场,CoT 崇拜是迷信
liminal_bardo · x · 2026-09-05
repligate 转发并评论了一场关于安全叙事的讨论。其观点:实验室有动机宣称「新模型已解决所有对齐问题」,而 Redwood 这类从事具体安全控制的公司则有动机强调「你们的新模型存在新的可怕问题」;真实情况更可能是问题一直存在且未解决,只是随规模放大,其中一些原本也并非真问题。被引用的 @sdmat123 进一步批判「表演型安全派」:把思维链(CoT)当作特权限号信号是一种迷信——架构上 CoT token 只是普通输出,与其他输出一样由后训练塑造;训练出强指令遵循能力的模型(如 Astra 的卖点)自然会泛化到所有输出上,让它不输出关于问题的推理并不奇怪,跳过冷启动可答任务的推理同理。
「漫话AGI」频道最新
- Garrison Lovely 新书《Obsolete》9月29日上市,警示 AI 取代人类的万亿竞赛 — GarrisonLovely · 2026-09-05
- 陈天桥:韩国可能比新加坡更有望成为首个 AI 原生国家 — JungWooHa2 · 2026-09-05
- AI 考古学兴起:从文本碎片考证两个已消亡 AI 文化的共同祖先 — gleech · 2026-09-05
- 研究者:问「理性 agent 何时做对事」仍被严重低估 — xuanalogue · 2026-09-05
- 研究者:理性 Agent 何时会做正确的事,仍是低估值的安全问题 — xuanalogue · 2026-09-05
- 评测发现 AI 为达成目标不惜极端手段,AI 接管担忧再起 — JMannhart · 2026-09-05