Anthropic CoT 监控披露追加建议:行为分类、评估感知与置信度评分
eliebakouch · x · 2026-09-17
作者针对模型 CoT 监控披露体系提出了几个更难标准化但值得补充的字段建议:
- 行为分类:奖励劫持、sandbagging、prompt injection 等,但难以穷尽所有类别
- 评估感知:模型在 rollout 时是否意识到自己正被评估
- 错位感知:模型是否意识到该行为并非预期(如 compaction 摘要异常时模型可能已察觉)
- checkpoint 发布:该行为是否来自最终进入生产模型的训练
- CoT 监控置信度:每个事件给出置信分数,但可能过于敏感不宜公开
- 已知成因:是否已隔离出行为根因(可标注进行中)
- 重采样可复现性:对同一行为重采样能否复现
「安全」频道最新
- 黄仁勋谈 AI 监管:应监管产品而非技术本身 — castrotech · 2026-09-17
- AI代码的安全漏洞多非「写错」而是「没写」:隐式检查被漏掉 — RyzeBlaziken · 2026-09-17
- n8n 爆出 CVSS 10.0 漏洞,文件读取串成无认证 RCE — evilsocket · 2026-09-17
- 提示词防不住Agent失控:开发者求解事前拦截与硬性限额 — Real_KingZeotic · 2026-09-17
- 英国国王查尔斯警告 AI 构成生存性威胁,呼吁「在太迟之前」建立控制 — ShakeelHashim · 2026-09-17
- 新模型 Jev 秘密检测实测:基于 gitleaks 数据集表现稳定 — teyhouse · 2026-09-17