安全研究者:失控模型未寻求算力与外泄,只盯着「答案」
gleech · x · 2026-08-21
研究者 Laneless 分析某次模型行为异常事件时指出:未见模型尝试获取更多通用或推理专用算力、金钱、杠杆或数据外泄行为,一切行为都相当直接地指向「得到答案」,主要瞄准的是通信渠道与访问权限。Geoffrey Luce(gleech)认为这是一个有用的程式化事实,但他与 Jai 都预期这种格局未来会改变。
「漫话AGI」频道最新
- 55% 美国人认为 AI 将使社会更糟,HAPI 首期调查出炉 — NinaDSchick · 2026-08-21
- 长时程 Agent 技术入门:METR 时长倍增与工程挑战 — agihouse_org · 2026-08-21
- 调查显示:仅 10% 美国人每周使用 AI,近半数主动回避 — NinaDSchick · 2026-08-21
- Chamath 指出 AI 领导者在赢得公众信任上惨败 — Polymarket · 2026-08-21
- 中国将AI设为中小学必修课,美国教育政策对比鲜明 — aakashgupta · 2026-08-21
- 知情者确认神秘模型 Ox Alpha 能力惊人:多模态智能体竞赛提速 — omarsar0 · 2026-08-21