Dario Amodei 相关回复提到 harness 无关训练与 Attention Residuals
peterjliu · x · 2026-07-29
这条回复讨论的是 Anthropic 的 post-training 思路,发帖人认为他们没有过拟合到 benchmark harness,而是尽量让模型保持 harness-agnostic。
回复重点提到一个名为 Attention Residuals 的设计:作者认为,attention 之所以比标准 RNN 更有效,关键在于它能访问前几步的状态,而不只是“上一层压缩后的状态”。标准 Transformer 会靠深度方向的 residual connection 去部分弥补这一点。回复者把这视为一种在前沿模型里并不常见的创新。
所属事件:Anthropic 被曝使用 Claude 编写 CUDA 代码(2 条相关)→
「模型」频道最新
- 开发者吐槽Claude Opus:聪明但缺乏严谨性,只爱干想干的活 — heyneighbor · 2026-07-30
- OpenAI 称 GPT-5.6 Sol 实现自我优化:服务成本降 20% — OpenAI · 2026-07-30
- Opus 4.8 推理密度暴增:Token 消耗达前版 6 倍 — jyangballin · 2026-07-30
- 逆向工程揭秘:Claude 分词器的奇特机制与异常行为 — soldni · 2026-07-30
- 开发者实测 Kimi K3:推理过程全透明成显著优势 — doodlestein · 2026-07-30
- 开发者利用 Grok 搭建验证群,低成本实现并行 Agent — rudrank · 2026-07-30