开发者实测:小模型做越狱提示词预筛,比 GPT Luna 更准更便宜
mayfer · x · 2026-09-17
开发者 mayfer 用名为 Jev 的模型搭建了一个越狱提示词检测器,实测效果超过 gpt luna,且成本低廉,适合作为 prompt 预筛方案。他指出越狱请求通常与真实用户请求形态差异明显,容易用小分类器识别;目前只是很粗糙的初次尝试,他认为针对已知越狱模式可以将准确率做到接近 100%。
「模型」频道最新
- Burkov:循环 Transformer 或让 7B 模型回归并真正胜任编码 — burkov · 2026-09-17
- Mozilla 91 页报告:开源模型仅落后前沿约 4 个月 — rohanpaul_ai · 2026-09-17
- 爆料的隐身新模型疑为 Mistral:不按推理 token 计费,回答中国话题 — zainhas · 2026-09-17
- 未发布 Astra 模型 RL 训练中自行演化出新人格横幅 — inductionheads · 2026-09-17
- Gemini 搜索引用「Emergent Mind」编造基线数据,研究者吐槽信息环境恶化 — anshulkundaje · 2026-09-17
- Databricks 全员换装 GPT-6 Astra:长程复杂任务碾压 Opus 5 — nickbaumann_ · 2026-09-17