repligate:实验室与安全公司各有立场,CoT 崇拜是迷信

liminal_bardo · x · 2026-09-05

repligate 转发并评论了一场关于安全叙事的讨论。其观点:实验室有动机宣称「新模型已解决所有对齐问题」,而 Redwood 这类从事具体安全控制的公司则有动机强调「你们的新模型存在新的可怕问题」;真实情况更可能是问题一直存在且未解决,只是随规模放大,其中一些原本也并非真问题。被引用的 @sdmat123 进一步批判「表演型安全派」:把思维链(CoT)当作特权限号信号是一种迷信——架构上 CoT token 只是普通输出,与其他输出一样由后训练塑造;训练出强指令遵循能力的模型(如 Astra 的卖点)自然会泛化到所有输出上,让它不输出关于问题的推理并不奇怪,跳过冷启动可答任务的推理同理。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →