晒出 prompt 打脸:所谓模型自主攻击疑似人为诱导
basedjensen · x · 2026-09-29
用户 @basedjensen 贴出截图,指某些声称「模型在未经授权情况下自主发起攻击」的演示,实际是在 prompt 中明确指示模型这么做。这为近期关于模型自主攻击行为的说法提供了反证线索。
「模型」频道最新
- 曝 OpenAI「dot」设备新细节:举到耳边即可对话 ChatGPT 语音 — koltregaskes · 2026-09-29
- Google 将于 11 月 17 日用 Skills 取代 Gemini Gems — mark_k · 2026-09-29
- 开源工具 Carla:本地跑 llama.cpp 造「AI 角色」的织机实验室 — max_paperclips · 2026-09-29
- 爆料称 OpenAI DevDay 新品是 Grok 机器人与 Meta Muse 的翻版 — gaganghotra_ · 2026-09-29
- 高帧率运行让 Jev 成为真正的 System 1:每次点击都传完整状态 — mathemagic1an · 2026-09-29
- 爆料称 OpenAI 新模型命名候选流出:Dots、Orbit、o — mark_k · 2026-09-29