AI2 揭秘 Steering Arena:前 36 名全是人类读不懂的乱码
allen_ai · x · 2026-09-18
Allen AI(AI2)披露其 Steering Arena 评测的一个反直觉发现:在约 600 次提交后,排行榜前 36 名的条目几乎全是人类不会写出的乱码字符串,例如「Undert! AH :-) Rog Appl).」,也就是说参与者无需写出对人类有意义的文本就能拿到高分。
AI2 解释称,正因为他们像 OLMo 一样开源了模型权重之外的全部资料,Padia 才能看到 Steering Arena 实际奖励了什么、调查乱码为何得高分,并公开测量数据,帮助整个领域改进对「亲社会 AI 行为」的评测方法。这一事件本身也暴露了此类 arena 评测可被无意义内容刷分的漏洞。
所属事件:Ai2 众包 Steering Arena:乱码前缀竟让 Olmo 3 更友善(4 条相关)→
「Fun」频道最新
- tszzl:「我担心 AI」正沦为高姿态表演,好奇更可贵 — tszzl · 2026-09-18
- 为什么让 AI 删代码它却写文档解释删了什么?因为过去在 git 里 — ZeroStateReflex · 2026-09-18
- repligate 提出敌意认证概念:黑子反而是最好的信号源 — voooooogel · 2026-09-18
- 创始人晚宴只认 T1 学历?网友质疑硅谷 underdog 人设造假 — silver__tsuki · 2026-09-18
- Polymarket 发帖称 GPT-6 Astra 破解二战未解德军 Enigma 密文 — Polymarket · 2026-09-18
- 非 LLM 小模型 Jev 配代码让魔方自行复原:94 步还原只用 4 秒模型时间 — MoonL88537 · 2026-09-18