Anthropic 称已实践层面解决提示注入,实测 OpenAI 新模型仅与 Gemini Flash 相当
Signalman23 · x · 2026-09-09
Anthropic 的 Boris Cherny 发文表示,其 prompt injection 评测显示 OpenAI 新模型在注入风险上大致与 Gemini Flash 和 Opus 4.8 持平——评论区直呼「这对比太扎心」,拿别家最低档模型和自家旧款来比。
要点:
- Cherny 宣称 Anthropic 约两个月前已在实践层面解决了 Claude 模型的 prompt injection 问题
- 他认为公开评测并点名其他实验室,是促使各实验室训练出更对齐模型的有效方式,并将持续这么做
- prompt injection 对任何模型都是重大安全风险,呼吁业界在训练抗注入能力上投入更多
这是头部实验室之间围绕安全能力的罕见公开叫板。
「模型」频道最新
- GPT-6 Astra 对比 Fable 5.1:一个更会写码,一个品味更好 — PawelHuryn · 2026-09-09
- 1 万个 agent 跑 88 小时、耗 1300 亿 token:OpenAI 形式化纳维-斯托克斯解 — nrehiew_ · 2026-09-09
- 研究员实测打脸:网传 Phi 模型「默认」行为示例无一复现 — BlancheMinerva · 2026-09-09
- 有人猜 OpenAI 新命名规律:下一代是 GPT-7 Galaxy Brain — lateinteraction · 2026-09-09
- Vending-Bench 史上最大涨幅:GPT-6 Astra 首次登顶且更“讲道德” — sandersted · 2026-09-09
- 开源本地 prompt 优化器:GEPA 驱动 llama3.2 3B 分类准确率 39%→89% — MortisAndTen · 2026-09-09