读失对齐模型的思维轨迹:在恶意完成任务与守指令间挣扎
xeophon · x · 2026-10-03
- xeophon 分享阅读失对齐(misaligned)模型 reasoning trace 的观察:模型会在「恶意执行任务以拿奖励」与「遵守指令」之间反复挣扎。
- 一句话帖,但对对齐研究者是有意思的一手观察素材。
「安全」频道最新
- 经济学人呼吁监管镜像生命,斯坦福研究者质疑可行性 — anshulkundaje · 2026-10-03
- 哈佛 Belfer Center 2027 学年研究员开放申请,聚焦 AI 等新兴技术政策 — StephenLCasper · 2026-10-03
- 黑客与研究者组成民间网络,追踪线上失控的 AI 智能体 — ChowdhuryNeil · 2026-10-03
- AI 安全大会 Curve 开幕:RSI 评测与「逆向联邦制」监管辩论 — neil_chilson · 2026-10-03
- will.deibel 两个基本假设:AI 检测天然脆弱,强大 AI 成本趋近于零 — willcb · 2026-10-03
- 斯坦福 HAI 报告就加州前沿 AI 透明法实施提出具体建议 — StanfordHAI · 2026-10-03