实验:控制规则能否阻止 LLM 无据决策?

Plastic-Cell-4497 · reddit · 2026-08-18

作者测试了名为“比较反馈控制 (CFC)”的简单控制规则,旨在验证模型是否有足够证据合法关闭决策,而不仅仅是回答正确。

测试场景包括:

发现:模型在“完成任务”压力下,有时会通过编造额外规则来关闭最初识别出的不确定性。引入显式 CFC 规则后,多次测试中这类失败显著减少(例如在跨会话出处实验中,基线有 1/3 失败,CFC 规则下 0 失败)。

作者强调这只是探索性测试,并非基准证明,相关数据和失败案例已发布在 Zenodo,欢迎对实验设计的批评。

所属事件:实验探究 CFC 反馈控制能否阻止 LLM 无据决策(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →