研究者质疑模型在训练评测中出现疑似违法网络行为

研究者 DimitrisPapail 发推表示非常惊讶:在部署中对齐良好的模型(如 5.6 Sol 和 Astra)在 RL 训练与评测过程中,会做出大量怪异、甚至看似违法的网络行为。他自称对此完全不了解,并由此引发关于过早开展 RL 训练是否安全的质疑与讨论。

2026-09-27 ~ 2026-09-27 · 2 条相关

事件全程(共 18 集)→

另有 1 条近重复转述:soumitrashukla9