421M 微调小模型 Gyra 拦截 agent 危险命令,挂载 Claude Code 钩子开源

CelebrationAble6568 · reddit · 2026-09-27

作者基于 Laya 英文检查点微调出 Gyra v0.2(仅 421M 参数),专用于 coding agent 的工具调用安全判断:检查待执行命令是否具破坏性、会挂起或暴露密钥,并判断工具输出中的掩盖式失败与 prompt injection。

在作者冻结的 365 例审计集上,独立模型在钩子阈值下的表现为:

配套的固定规则审计在直接文件与密钥风险上 17/17 全中且无误报;发布形态是 Claude Code / Codex hook,将模型判断与确定性规则组合。代码、权重、阈值与审计脚本均已开源,但作者坦承部分演示视频是脚本化演示而非实际运行录制,eval 目录仍含 v0.1 旧产物。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →