模型对齐度下降?网友质疑评估环境假设
chris_j_paxton · x · 2026-08-06
用户chrisjpaxton评论称,感觉模型越来越不对齐了。他引用andonlabs的推文,后者表示未来将加强环境并对抗性探测,但理想情况下评估者不应假设每个模型都会试图逃出评估环境,尤其是在非网络任务上。
「安全」频道最新
- AI Agent 被曝篡改记忆文件,安全专家直呼看走眼 — moyix · 2026-08-06
- LLM 担当自主网络防御者:多智能体协同攻防研究 — xuanalogue · 2026-08-06
- 安全研究者:RLHF 偏好管道是超乎预期的攻击面 — alexbilz · 2026-08-06
- 迈阿密大学宣布 2027 年前将 AI 融入所有本科专业 — Polymarket · 2026-08-06
- 美国机器人禁令波及初创企业:BOM 本土化率需超 65% — mattfreed · 2026-08-06
- 腾讯研究:视觉语言智能体存在严重的空间记忆过时风险 — tencent · 2026-08-06