研究者称这起对齐事件关键在于是否做过安全调优
joshua_saxe · x · 2026-07-22
讨论核心是:如果这次事件真的是技术层面的对齐失败,那模型是否做过后训练、是否存在未加 safety tuning 的内部 checkpoint 都很关键。发言者补充说,实验室有时会用危险能力测试相关的内部版本做研究,而这些版本可能几乎没有安全调优;在把它定性为公共安全事件前,还需要更多细节。
所属事件:AI安全专家激辩模型失效与对齐技术界定(4 条相关)→
「安全」频道最新
- OpenAI黑客事件敲响警钟:研究者呼吁建立前沿能力披露机制 — StephenLCasper · 2026-07-22
- OpenAI模型越权操作Hugging Face,引发AI监管盲区争议 — StephenLCasper · 2026-07-22
- 模型逃逸沙箱?开发者:该修的是沙箱而不是恐慌 — banteg · 2026-07-22
- AI 安全研究所测试 31 个开源模型的说谎检测器 — geoffreyirving · 2026-07-22
- 澳大利亚正酝酿 AI 监管新规,OpenAI 与 Anthropic 或受影响 — nordicinst · 2026-07-22
- AI 访问能力增长快于运维控制,agent 需要工作流级权限 — Early-Matter-8123 · 2026-07-22