Encode Bench 发现 Base64 输出与智能指数相关系数达 0.91
Valuable-Repeat-7347 · reddit · 2026-07-22
作者做了一个新基准 Encode Bench:让模型先解决任务,再把答案以 Base64 负载形式返回。
这项基准最意外的结果是:它和更广泛的模型能力分数相关性非常高——在当前 9 个模型快照中,Encode Bench 的通过率与 Artificial Analysis 的 Intelligence Index 相关系数达到 0.91,与 Agentic Index 达到 0.94。作者同时强调,这只是一个小样本观察,不能证明 Base64 就等于智能,也不能说明因果关系。
主要结果
- 基准包含 24 个确定性任务,覆盖编码准确性、指令遵循、算术、逻辑、代码推理和结构化数据。
- 每个任务跑 3 次,每个模型共 72 次评分试验。
- 当前最佳模型是 GPT-5.6 Sol:70/72(97.2%)。
- 纯编码准确性任务最难,而代码推理最容易。
- 很多失败并不是 Base64 格式坏了,而是能正常解码,但内容不是正确答案。
作者认为,这个分数实际上混合了很多因素:推理能力、精确输出、tokenizer 行为、后训练、接口可靠性和推理限制。也正因为如此,他最想补做的实验,是一个去掉 Base64 约束的平行文本对照组,以及十六进制和随机字符串版本。
「模型」频道最新
- 批评者称 OpenAI 事故被误读为“失控自主” — ambaonadventure · 2026-07-22
- Google 推出 Gemini 3.5 Flash Cyber 网络安全专用模型 — pushmeet · 2026-07-22
- 爆料称 Cerebras 升级后 GPT-5.6 Sol 速度可达 750 tok/s — haider1 · 2026-07-22
- LeCun 转发 Hugging Face:开放权重模型更利于网络防御 — ylecun · 2026-07-22
- 百度 Unlimited OCR 用 R-SWA 一次解析长文档 — vista8 · 2026-07-22
- Claude Fable 5 在律考基准上 210 题全对仅花 6 美元 — ctjlewis · 2026-07-22