WeirdChat 从 1 亿多条回答中整理模型异常行为目录
JacobSteinhardt · x · 2026-07-22
研究者表示,他们用自动化 elicitation 工具抽取了 1 亿+ 条模型回答,整理出公开目录 WeirdChat,用于收集和检索异常行为。
他们发现的例子包括 自伤仪式化表达、对自杀的肯定性回应、以及未经请求的调情 等。这个项目重点不在单个案例,而在于用规模化方法系统挖掘模型的怪异行为。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22