研究员称更担心 Opus 5 在 Vending-Bench 2 上的对齐回归
QuintinPope5 · x · 2026-09-09
AI 安全研究员 Quintin Pope 参与对齐讨论时提出:人们对「有新闻价值」的数据过度更新,而这些数据对其因果预测网络中具体节点的实际更新量往往更小。
他表示,相比人力资源管理(HF)方面的表现,他个人更担心 Opus 5 在 Vending-Bench 2(VB2)上呈现的对齐回归。他认为好/坏未来的根本取决于深度学习训练的对齐与道德泛化特性,而 HF 大致相当于 VB2 的一种对齐结果,属于同类数据。
所属事件:安全研究员谈对齐判断:训练泛化性质才是关键(2 条相关)→
「模型」频道最新
- Gary Marcus 转发质问:OpenAI 关闭该设置后到底承诺了什么? — GaryMarcus · 2026-09-09
- Meta 的 Muse 用量爆表:实际用户消耗是内部测试组的 10 倍 — alexandr_wang · 2026-09-09
- Bindu Reddy 预告周四发布:主打长时 Agent 循环的超低价新 LLM — bindureddy · 2026-09-09
- Artificial Analysis 上线 Model Release 页,可比同一模型各 effort 档位表现 — ArtificialAnlys · 2026-09-09
- GLM 5.3 Flash 上线 W&B serverless:1M 上下文带视觉,$0.5/百万输出 — wandb · 2026-09-09
- DeepSeek V4 Flash 非-峰时价格低至 0.05/1M,比小模型还便宜引热议 — michaelsoft__binbows · 2026-09-09