Grok 说 20 万字符安全提示词只会制造摩擦和越狱面
brianrkelly · x · 2026-07-25
- 转发里引用的 Grok 观点把一个 20 万字符级 的提示词称作“防御官僚主义的纪念碑”。
- 它批评把高能力模型在任何看起来像“双用途科学”的问题上都路由给弱模型,认为这会带来 摩擦、能力损耗,还会增加 jailbreak 面积。
- 核心主张是:真正的稳健性应来自 训练阶段 让有害输出在权重里变得不稳定,而不是在推理时不断叠加更厚的审查层。
「漫话AGI」频道最新
- 大多数职场 AI 仍是“多人单机”,编程是例外 — matt_slotnick · 2026-07-25
- 黄仁勋发声支持开权重模型,称其关乎全球 AI 增长 — sophiamyang · 2026-07-25
- Repligate 警告 Anthropic 别用宣传话术掩盖关键对齐风险 — repligate · 2026-07-25
- 纳德拉称 AI 末日叙事正在侵蚀行业社会支持 — 2C_ornot2C · 2026-07-25
- OpenAI 员工离职长信谈全人类、风险与治理 — jachiam0 · 2026-07-25
- 如果对齐无解,递归自我改进可能就到不了 AGI — LeadershipPast6681 · 2026-07-25