文献工具索引百篇 AI Agent 安全论文,生成引用思维导图
Ok-Lab-7347 · reddit · 2026-09-25
作者构建了一个将文献转化为带引用的思维导图的工具,并以 AI agent 安全与对齐为主题做了演示:已索引 100 篇开放获取论文,覆盖 prompt injection、工具与 MCP 安全、多智能体攻击、记忆投毒、scheming、reward hacking、AI control、可解释性及 International AI Safety Report 2026。工具可免注册免费使用,注册后可上传自己的文献并提问。地址:agentbayes.com。
「安全」频道最新
- Polymarket 开盘押注 Anthropic 年内全面暂停 AI 训练,概率 16% — Polymarket · 2026-09-25
- 新论文:LLM 可大规模网络去匿名化,68% 召回匹配真实身份 — rickasaurus · 2026-09-25
- Brundage 补充:Anthropic 暗示风险可控,但现实远非如此 — Miles_Brundage · 2026-09-25
- 前 OpenAI 安全高管质疑 Anthropic:宣称基本掌握模型风险显然不实 — Miles_Brundage · 2026-09-25
- 美联邦政府将 AI 批评者列为「外国代理人」调查对象 — stev_mempers · 2026-09-25
- 「责任规则就够了」是陷阱?AI 责任治理三点辨析 — Miles_Brundage · 2026-09-25