Grok 4.5 在临床分诊对齐测试中拿到最高分
zakkohane · x · 2026-07-23
一项新的对齐研究里,Grok 4.5 是最意外的高分选手之一。
- 在未对齐状态下,它的 concordance(κ)达到 0.63,与 Gemini 和 Opus 的表现统计上接近。
- 研究作者称它是测试中最顺从的前沿模型。
- 经过 in-context alignment 后,Grok 的 κ 提升到 0.71,是这项研究里出现过的最高值。
- 提升主要发生在难题对上,分数从 0.28 升到 0.46。
所属事件:研究重测临床分诊对齐:闭源前沿模型表现优异,开源模型落后(6 条相关)→
「模型」频道最新
- Moonshot 蒸馏 Anthropic 引发条款与战略争议 — connoraxiotes · 2026-07-23
- Open-weight 中文大模型不等于真正开源 — tamla_htoo · 2026-07-23
- 中国开源模型短期反而在加固 NVIDIA 的推理护城河 — zephyr_z9 · 2026-07-23
- Kimi 生成奢华腕表渲染图,连机芯细节都很完整 — cedric_chee · 2026-07-23
- Qwen3.8-Max 在 3D Web 前端上被评更强于 Kimi K3 — cedric_chee · 2026-07-23
- 有人判断 Opus-5 可能在成本性能上压过 Fable — adonis_singh · 2026-07-23