按思考强度调成本?

nrehiew_ · x · 2026-07-16

在讨论一种“按 token 调整成本”的训练/推理机制时,作者猜测这可能是在根据思考强度调整长度惩罚,从而影响了 CoT 里更压缩的表达方式。

这条是基于对相关结果的推测,不是官方确认,但指向的是模型训练信号如何塑造输出风格。

所属事件:Inkling 表现与相关架构猜测升温(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →