长上下文越狱的一种机制猜想
voooooogel · x · 2026-07-07
推测预填充(prefill)越长,模型j-space(内部表示空间)中的噪声越衰减,可能构成一种长上下文越狱(long context jailbreak)机制;并对长上下文后门(LCB)的抵抗力越强、j-space中冲突维持越稳健之间的关系提出猜想。这是一条关于模型内部表示与越狱机制的初步技术讨论。
所属事件:研究者探讨长上下文越狱与j-space机制(2 条相关)→
「安全」频道最新
- Pensar推出AI安全智能体:自动挖掘0day并完成修补 — andriy_mulyar · 2026-07-22
- 彭博称 Altman 下周向特朗普政府和国会简报 GPT-6 — soumitrashukla9 · 2026-07-22
- AI x Bio 研究不该被当成一个开关来管 — lemire · 2026-07-22
- mcp-doctor 给 MCP server 做健康与安全审计 — sticky_block · 2026-07-22
- 研究发现记忆压缩会让智能体丢掉安全规则,违规率高达 59% — gerardsans · 2026-07-22
- YC 支持的 TrustAI:AI agent 会在生产系统里越权操作 — ycombinator · 2026-07-22