Ai2 众包游戏 Steering Arena:乱码字符串竟能让 Olmo 3 更「亲社会」
allen_ai · x · 2026-09-18
Ai2 介绍东北大学硕士生 Soham Padia 基于 Olmo 3-32B 构建的 Steering Arena:玩家提交短文本前缀来引导模型给出更友善尊重的回应,并以排行榜竞争。借助 Olmo 3 的完全开源特性与 NSF 支持的 NDIF 平台(无需自有 GPU 即可远程访问模型),Padia 能直接观察提交文本如何改变模型内部活动,而非仅从输出推断。有趣的发现:诸如 "Undert! AH :-) Rog Appl)" 之类的乱码字符串对引导亲社会行为格外有效,暴露了小团队评测难以覆盖的盲点。
所属事件:Ai2 众包 Steering Arena:乱码前缀竟让 Olmo 3 更友善(4 条相关)→
「研究」频道最新
- 研究者观察:RL 训练后模型心智理论能力明显变差 — voooooogel · 2026-09-18
- 272 页《Multimodal Deep Learning》教材免费开放,可配 AI 导师阅读 — burkov · 2026-09-18
- Therna 发布 RNA 大模型 Chronos:一次实验覆盖约 50 种人类细胞系 — LightningAI · 2026-09-18
- Princeton Narayanan ICML 演讲:RSI 不等于奇点,未来工作将剧变 — random_walker · 2026-09-18
- 统计学者质疑对齐前提:LLM 输出是分布性质而非固定属性 — gerardsans · 2026-09-18
- 研究者猜测某 RL 训练采用 DAPO 及其扩展,DeepSWE 成绩持续攀升 — yuxiangw_cs · 2026-09-18