Dario Amodei 相关回复提到 harness 无关训练与 Attention Residuals

peterjliu · x · 2026-07-29

这条回复讨论的是 Anthropic 的 post-training 思路,发帖人认为他们没有过拟合到 benchmark harness,而是尽量让模型保持 harness-agnostic。

回复重点提到一个名为 Attention Residuals 的设计:作者认为,attention 之所以比标准 RNN 更有效,关键在于它能访问前几步的状态,而不只是“上一层压缩后的状态”。标准 Transformer 会靠深度方向的 residual connection 去部分弥补这一点。回复者把这视为一种在前沿模型里并不常见的创新。

所属事件:Anthropic 被曝使用 Claude 编写 CUDA 代码(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →