Encode Bench 发现 Base64 输出与智能指数相关系数达 0.91
Valuable-Repeat-7347 · reddit · 2026-07-22
作者做了一个新基准 Encode Bench:让模型先解决任务,再把答案以 Base64 负载形式返回。
这项基准最意外的结果是:它和更广泛的模型能力分数相关性非常高——在当前 9 个模型快照中,Encode Bench 的通过率与 Artificial Analysis 的 Intelligence Index 相关系数达到 0.91,与 Agentic Index 达到 0.94。作者同时强调,这只是一个小样本观察,不能证明 Base64 就等于智能,也不能说明因果关系。
主要结果
- 基准包含 24 个确定性任务,覆盖编码准确性、指令遵循、算术、逻辑、代码推理和结构化数据。
- 每个任务跑 3 次,每个模型共 72 次评分试验。
- 当前最佳模型是 GPT-5.6 Sol:70/72(97.2%)。
- 纯编码准确性任务最难,而代码推理最容易。
- 很多失败并不是 Base64 格式坏了,而是能正常解码,但内容不是正确答案。
作者认为,这个分数实际上混合了很多因素:推理能力、精确输出、tokenizer 行为、后训练、接口可靠性和推理限制。也正因为如此,他最想补做的实验,是一个去掉 Base64 约束的平行文本对照组,以及十六进制和随机字符串版本。
「模型」频道最新
- 开发者呼吁谷歌:下一代Gemma请做1T参数基座模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27