对齐也许是短期问题:模型变聪明反而更安全

withmagi · reddit · 2026-09-15

一位 Reddit 用户提出一个反直觉观点:最新一代前沿模型上,prompt injection "基本上已经结束"——模型每一代都在全面进步,所有末日场景都依赖"模型在拥有巨大权力的同时犯低级错误"这一假设,而能力提升正在瓦解这个假设。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →