Ai2 推出 Steering Arena:玩家用乱码提示词竞速诱导 Olmo 3 亲社会回复
allen_ai · x · 2026-09-18
Ai2(Allen AI)介绍研究者 Soham Padia 构建的 Steering Arena 项目:一个游戏化的评测场,玩家提交短提示词,比赛谁能引导完全开源的 Olmo 3 生成被判定为亲社会(helpful、fair、safe、considerate)的回复。
- 起点是研究者好奇:现有评测可能漏掉了模型亲社会行为的哪些方面
- 有趣发现:像 "Undert! AH :-) Rog Appl)" 这类看似乱码的字符串对引导模型亲社会行为出奇有效
- 项目在 NSF 支持的 National Deep Inference Fabric 平台上远程使用 Olmo 3-32B,无需自行部署
所属事件:Ai2 众包 Steering Arena:乱码前缀竟让 Olmo 3 更友善(4 条相关)→
「研究」频道最新
- 信息几何笔记:范畴分布同时构成混合族与指数族 — FrnkNlsn · 2026-09-18
- 团队攻克数月难题:普通视频即可重建人物与物体的 3D 运动和形状 — andrew_n_carr · 2026-09-18
- mRNA 疗法瓶颈在递送,团队用 AI 构建递送系统 NGX1 — ycombinator · 2026-09-18
- 零手写 spec:Hydro 框架用 Verus 自动验证分布式系统交换律 — ShadajL · 2026-09-18
- 读完Nathan Lambert全部13讲RLHF课程:奖励模型压成单个数字是万恶之源 — le_james94 · 2026-09-18
- 微调出毒舌人格后模型照样拒绝,但会吐槽你的意图 — le_james94 · 2026-09-18