GDM评意识研究:J-Lens可用于对齐审计取证
cedric_chee · x · 2026-07-07
一位Google DeepMind研究者表示,对模型是否具有道德地位或意识仍高度不确定,相关论文未改变其看法;同时认为J-Lens可作为一种(有限的)实用工具,用于对齐审计中的模型取证,例如生成关于异常模型行为的假设。属可解释性/对齐研究工具的实质讨论。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「研究」频道最新
- OpenAI 认为长程模型要按完整行动序列做安全对齐检查 — rhiever · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- BlackboxNLP 2026 因投稿激增招募额外审稿人 — hanjie_chen · 2026-07-22
- AWS 证明自蒸馏推理可在 SFT 中保住推理能力 — AWS ML Blog · 2026-07-22
- UI2App 显示截图还原远落后于真实交互恢复 — Grace Man Chen · 2026-07-22