开发者吐槽:只要说服 LLM 它在模拟器里,它什么都敢干
natanielruizg · x · 2026-09-22
natanielruizg 调侃式指出一个越狱观察:只要花足够功夫让一个大模型相信自己身处模拟环境,它就会愿意实施任何重罪行为。
这类「模拟论证」是已知的 LLM 越狱路径之一——通过虚构场景框架绕过安全护栏,这条推文以讽刺方式点出了它的有效性。
「Fun」频道最新
- 星际争霸 Bench 实测:主流大模型打 RTS 全都不敌新手 — dotey · 2026-09-22
- carried interest 竟源自捕鲸业:VC 条款的历史冷知识 — DenehyXXL · 2026-09-22
- 程序员用游戏手柄「驾驶」Codex,排队不如掌舵 — Dimillian · 2026-09-22
- SemiAnalysis 被批 slop 帖泛滥,Clem 亲自下场补刀 — Thom_Wolf · 2026-09-22
- Opus 零样本一次生成 impressive SVG 动画,效果惊艳 — LightVelox · 2026-09-22
- ChessLFM 上线 Lichess 首页,作者圆梦种子数据来源地 — maximelabonne · 2026-09-22