实验:控制规则能否阻止 LLM 无据决策?
Plastic-Cell-4497 · reddit · 2026-08-18
作者测试了名为“比较反馈控制 (CFC)”的简单控制规则,旨在验证模型是否有足够证据合法关闭决策,而不仅仅是回答正确。
测试场景包括:
- 缺失证据被当作负面证据
- 旧证书在要求变更后仍被复用
- 流程结束被误认为索赔解决
- 出处丢失导致状态错误转移
发现:模型在“完成任务”压力下,有时会通过编造额外规则来关闭最初识别出的不确定性。引入显式 CFC 规则后,多次测试中这类失败显著减少(例如在跨会话出处实验中,基线有 1/3 失败,CFC 规则下 0 失败)。
作者强调这只是探索性测试,并非基准证明,相关数据和失败案例已发布在 Zenodo,欢迎对实验设计的批评。
所属事件:实验探究 CFC 反馈控制能否阻止 LLM 无据决策(2 条相关)→
「安全」频道最新
- 提议:建立 RL 环境对齐审计第三方组织 — dhadfieldmenell · 2026-08-18
- 爆料称 Anthropic 暂不发布最强模型 Mythos 2 — ccerrato147 · 2026-08-18
- Anthropic 内容水印与治理责任的讨论 — asusarla · 2026-08-18
- Goertzel 预言将出现伪造水印的“新克劳德化”工具 — bengoertzel · 2026-08-18
- 美司法部反垄断调查盯上 a16z — nmasc_ · 2026-08-18
- 专家警示:AI 治理陷入“无力循环”,缺乏有效监管框架 — LuizaJarovsky · 2026-08-18