RegLLM 诊断框架:测受监管 Agentic AI 的有界自主性
Dipankar Sarkar · hf · 2026-10-01
Dipankar Sarkar 发布 RegLLM,一个诊断有界自主性(bounded autonomy)的测试框架,面向受监管的 agentic 工作流:
- 六类可信信号:引用有效性、来源接地、schema 合规、升级正确性、宪法对齐、不安全动作率;按监督来源分程序验证器/任务级升级标签/AI 评委
- 运行时治理:确定性监督器拦截无根据回答并强制升级,同一「领域宪法」同时驱动评估、训练奖励与线上护栏
- 小规模实验(n=12):开启治理后升级召回从 0 升至 0.67,不安全动作率从 0.33 降至 0.08
- 关键发现:两次单卡 Qwen2.5-3B LoRA/DPO 试点显示,名义相同的 RL-base 配置结果差异巨大(任务成功率 0.25 vs 0.12),配置方差可能淹没调参效应——作者明确声明不证明生产可用,贡献在诊断层面
「编程与Agent」频道最新
- CMU 发布 CUA-SWE:让计算机使用 Agent 做可视化软件工程 — CarnegieMellonU · 2026-10-01
- 多 Claude Code 并行协作内核 Médula:快决策器 61% 写请求需升级慢通道 — jokiruiz · 2026-10-01
- 三个 AI 销售Agent撞单同一客户,团队用共享记忆层修复 — Davnys · 2026-10-01
- 不必写详细反馈,一句「这不行」就能让编码 Agent 自己改好 — bosmeny · 2026-10-01
- Claude 全流程复刻物理博主视频:写脚本、配音、剪辑一条龙 — AndyMasley · 2026-10-01
- GitHub 提出智能体工程系统 AES:治理、知识与价值三要素框架 — marlene_zw · 2026-10-01