Hugging Face 研究员:加密推理让 LLM 评测完全失真
_lewtun · x · 2026-10-06
Hugging Face 研究员 Lewis Tunstall(lewtun)抛出观点:加密推理(encrypted reasoning)是 LLM 评测遭遇的最糟事情,并附上相关讨论链接。
这一说法指向近年部分模型用大量加密/不可读的隐藏思维链推高表现,使外部 benchmark 难以核实模型真实推理过程与得分可信度的问题。帖内未展开论证,属值得关注的评测方法论争议。
「模型」频道最新
- Anthropic 分词器效率偏低,直接比 token 数的算账不靠谱 — JoshPurtell · 2026-10-06
- 有人算账了:Codex 订阅可能靠 API 收入隐性补贴 — JoshPurtell · 2026-10-06
- Reflection 发 Beam 号称西方开源前沿,关键编码测试仍落后 Qwen、DeepSeek — TheTuringPost · 2026-10-06
- Reflection 发布 5010 亿参数开放权重模型 Beam — BVCC6FNTKX · 2026-10-06
- Reflection 发布美国最强开源模型,社区称达 SoTA 水平 — bigblueboo · 2026-10-06
- 实测对比:开源新模型 Beam 不敌 DeepSeek Flash — bindureddy · 2026-10-06