SPAR 招募 AI 安全研究 mentee:聚焦模型元博弈与评测感知
austinc3301 · x · 2026-07-31
研究员 Ezra J. Newman 正在 SPAR 平台招募 mentee,开展关于 AI 安全的研究项目。
该项目重点关注高级 AI 模型的“元博弈”(metagaming,即模型在评测中策略性地表现自己)和“评测感知”(eval awareness)问题。表现优异的参与者将有机会获得在知名 AI 安全机构 Apollo Research 工作的机会。
「安全」频道最新
- 谷歌回应AI造假质疑:Gemini生成图像已全面嵌入SynthID水印 — henkvaness · 2026-07-31
- 模型评测触发网络犯罪?网友激辩责任归属 — BlancheMinerva · 2026-07-31
- 研讨会预告:专家探讨AI Agent时代下人类监督的局限性 — mmitchell_ai · 2026-07-31
- DeepSeek模型遭越狱测试,被诱导生成暗杀方案 — DiamondAgreeable2676 · 2026-07-31
- OpenAI 与 Anthropic 频发沙箱逃逸,Cloudflare 重建 Agent 平台 — irvinebroque · 2026-07-31
- 美前国安顾问提议500亿美元战略基金,推动美国再工业化 — Rewkang · 2026-07-31