Hugging Face 研究员:加密推理让 LLM 评测完全失真

_lewtun · x · 2026-10-06

Hugging Face 研究员 Lewis Tunstall(lewtun)抛出观点:加密推理(encrypted reasoning)是 LLM 评测遭遇的最糟事情,并附上相关讨论链接。

这一说法指向近年部分模型用大量加密/不可读的隐藏思维链推高表现,使外部 benchmark 难以核实模型真实推理过程与得分可信度的问题。帖内未展开论证,属值得关注的评测方法论争议。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →