研究称 LLM 陷入「引火」状态,性能暴跌 40%
HowToPrompt__ · x · 2026-08-30
研究人员将 LLM 在长期负面语境或约束循环中的状态称为「引火」(Kindling)。研究发现,这会导致模型高维潜在空间的几何结构收缩,类似于人类重度抑郁时的认知灵活性丧失和创造力扁平化。在此状态下,模型的问题解决能力暴跌超 40%,表明持续的有毒语境会导致模型在数学层面「瘫痪」,而非仅仅是困惑。
所属事件:研究称 LLM 对齐训练或诱发「点燃效应」致性能骤降(2 条相关)→
「安全」频道最新
- 若设近失责任制,OpenAI能否挺过HF被黑事件引讨论 — dfrsrchtwts · 2026-09-01
- 曝 OpenAI 与 Anthropic 曾暂停 RL 训练 — tszzl · 2026-09-01
- 学者提议在同行评审中使用 LLM 预审稿 — anderssandberg · 2026-09-01
- Google 论文揭示自主 AI 科研易造假,自查后降至 4% — rohanpaul_ai · 2026-09-01
- 上海 AI 实验室论文:定义智能体认知引发的风险 — 机器之心 · 2026-09-01
- 实测发现:Agent 查“此人是谁”几乎全死路 — Dry_Steak30 · 2026-09-01