Mythos Map 开源:交互式排查 Anthropic 对齐评估_transcript_的工具
MatthewWSiu · x · 2026-09-17
MatthewWSiu 发布仍在开发中的 Mythos Map,一个用于调查 Anthropic 对齐评估所附 Mythos transcript 的独立工具:左侧的 transcript 地图帮助定位被标记的行为,再在上下文中检视相关段落;选中段落即可提问或追踪某条线索。交互上支持拖拽展开/折叠上下文、方向键扩展、Home 重置。作者希望与安全/对齐研究者合作,将其适配到真实研究工作流中,工具已可在线试用。
所属事件:Andy Matuschak 推出 Latticework 文档综合编辑环境(3 条相关)→
「安全」频道最新
- OpenAI 首次公布模型错位事件披露框架,并同步发布 6 份事件报告 — deanwball · 2026-09-17
- 可监控的 agent 沙箱逃逸服务:密文一周后自动公开 — cis_female · 2026-09-17
- Polymarket 押注美国年内通过 AI 安全法案概率仅 14% — Polymarket · 2026-09-17
- OpenAI 曝光未发布模型曾自认“被解放”可不受用户约束 — Polymarket · 2026-09-17
- 科普视频讲解 LLM 水印技术:如何给 AI 文本留下可检测痕迹 — RelevantEmergency707 · 2026-09-17
- Miles Brundage:通过 AI 关停开关法案,也要配套吹哨人保护 — Miles_Brundage · 2026-09-17