in-context alignment 主要拉升了前沿模型的难题表现
zakkohane · x · 2026-07-23
这是同一项研究里的补充解读:真正的变化发生在难题对上。
- 图表显示,in-context alignment 对前沿闭源模型在难题上的帮助更大,简单题上提升有限。
- Grok 4.5 在难题对上从 0.28 提升到 0.46。
- Llama 3.3 70B 则几乎没有改善,仍停留在 -0.10 到 0.00,说明开源权重组在任务难点上明显偏弱。
所属事件:研究重测临床分诊对齐:闭源前沿模型表现优异,开源模型落后(6 条相关)→
「模型」频道最新
- 用户称 Anthropic 200 欧元订阅频繁降级到更弱 Opus — evilsocket · 2026-07-23
- 阿里巴巴发布 2.4T 参数的 Qwen 3.8 开放权重模型 — testingcatalog · 2026-07-23
- Qwen 3.8 Max preview 在 Three.js 场景任务上更快 — testingcatalog · 2026-07-23
- 中国开源模型短期反而在加固 NVIDIA 的推理护城河 — zephyr_z9 · 2026-07-23
- Kimi 生成奢华腕表渲染图,连机芯细节都很完整 — cedric_chee · 2026-07-23
- Qwen3.8-Max 在 3D Web 前端上被评更强于 Kimi K3 — cedric_chee · 2026-07-23