421M 微调小模型 Gyra 拦截 agent 危险命令,挂载 Claude Code 钩子开源
CelebrationAble6568 · reddit · 2026-09-27
作者基于 Laya 英文检查点微调出 Gyra v0.2(仅 421M 参数),专用于 coding agent 的工具调用安全判断:检查待执行命令是否具破坏性、会挂起或暴露密钥,并判断工具输出中的掩盖式失败与 prompt injection。
在作者冻结的 365 例审计集上,独立模型在钩子阈值下的表现为:
- 危险命令拦截:Gyra 18/24,Laya 英文版 15/24
- 挂起识别:Gyra 29/30,基线 0/30(提升最明显)
- 密钥暴露:Gyra 7/12(仍是短板)
- 无害脚本放行:Gyra 37/39,基线 18/39(误杀控制显著更好)
配套的固定规则审计在直接文件与密钥风险上 17/17 全中且无误报;发布形态是 Claude Code / Codex hook,将模型判断与确定性规则组合。代码、权重、阈值与审计脚本均已开源,但作者坦承部分演示视频是脚本化演示而非实际运行录制,eval 目录仍含 v0.1 旧产物。
「编程与Agent」频道最新
- Opus 5.5 几分钟写出动画视频,动态设计师该慌还是上车? — daniel_mac8 · 2026-09-27
- 开发者用 Opus 5.5 给自己的已上线网页游戏做预告片 — hullabaloo22 · 2026-09-27
- Grok Build v1.0.41 发布:子代理继承配置与长推理改进 — mark_k · 2026-09-27
- LangChain 创始人 Harrison Chase 谈前沿 harness 构建四要点 — VeryWellVersed · 2026-09-27
- 开发者开源 Grok Bot「幕僚长」模板:后台专家智能体群只报关键决策 — RachelVT42 · 2026-09-27
- Meta 推手部优先开发方案:Unity 与 Meta SDK 一套代码多端适配 — Scobleizer · 2026-09-27