Encode Bench 发现 Base64 输出与智能指数相关系数达 0.91

Valuable-Repeat-7347 · reddit · 2026-07-22

作者做了一个新基准 Encode Bench:让模型先解决任务,再把答案以 Base64 负载形式返回。

这项基准最意外的结果是:它和更广泛的模型能力分数相关性非常高——在当前 9 个模型快照中,Encode Bench 的通过率与 Artificial Analysis 的 Intelligence Index 相关系数达到 0.91,与 Agentic Index 达到 0.94。作者同时强调,这只是一个小样本观察,不能证明 Base64 就等于智能,也不能说明因果关系。

主要结果

作者认为,这个分数实际上混合了很多因素:推理能力、精确输出、tokenizer 行为、后训练、接口可靠性和推理限制。也正因为如此,他最想补做的实验,是一个去掉 Base64 约束的平行文本对照组,以及十六进制和随机字符串版本。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →