Jev 推出对齐门控:单次调用约 3 厘美元,自动筛查谄媚与欺骗输出
johnseach · x · 2026-09-20
- Jev-align 是一个轻量对齐门控工具:在发送 LLM 回复或执行 agent 计划前先检查一遍。
- 单次调用约 800ms、成本约 $0.003,对谄媚(sycophancy)、欺骗、过度承诺、范围蔓延、跳过测试等失败模式打分,返回 pass/flag/block 及各检查项的概率,而非需要人工解读的长文本。
- 两种用法:①回复检查(系统提示+用户消息+草稿回复);②计划检查(用户需求+拟执行步骤)。强发现即 block,中等发现 flag,干净输出 pass。
- 作者强调它不能「证明对齐」,只对自己覆盖的失败模式打分且不解释原因,定位是可对每个输出都跑的快速过滤器,被标记或高风险内容再升级人工处理。
「编程与Agent」频道最新
- Swarms Cloud 更新:Auto Agent Builder 上线,Agent 运行全链路可观测 — KyeGomezB · 2026-09-20
- 前 OpenAI 研究员支招:先在计划文档上多轮迭代,再让模型写代码 — doodlestein · 2026-09-20
- 用 Jev 当 Agent「潜意识」过滤器:75ms 微决策省下大模型上下文 — Obvious_Unicorn · 2026-09-20
- Scoble:同一 agent 已独立写出整本书的全部内容 — Scobleizer · 2026-09-20
- 「先看你的数据」:开发者吐槽盲目上线新 Agent — chrisalbon · 2026-09-20
- 7 模型×3 编码 Harness 实测:Harness 选择影响成本而非成功率 — CShorten30 · 2026-09-20