研究称 Grok 4.5 在对齐测试中追平 Gemini 和 Opus

zakkohane · x · 2026-07-23

这条帖子转述了一项后续研究:在对齐/一致性类评测里,Grok 4.5 的表现意外地不错。

整体看,这是一条关于模型对齐行为、可控性与评测表现的模型动态更新。

所属事件:研究重测临床分诊对齐:闭源前沿模型表现优异,开源模型落后(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →