Grok-4.6 曝光:跨 ARC-AGI 各代测试泛化表现出色
zainhas · x · 2026-09-14
有用户观察到 Grok-4.6 在 ARC-AGI 各代测试上表现出良好的泛化能力,称其 "killing it"。此为第三方观察,尚未见 xAI 官方确认,具体成绩与发布信息待验证。
「模型」频道最新
- 让 Claude 不那么「Claude 味」有多难?工程师:最后只好搞语言学 — menhguin · 2026-09-14
- 回看 2019:OpenAI 曾因「太危险」拒绝公开 GPT-2 — timigod · 2026-09-14
- 实测对比:ChatGPT 迎合胡说,Claude 直接说「这话没意义」 — flowersslop · 2026-09-14
- Agent 轨迹数据集月下载超 5 万,作者猜被用于 SFT 与奖励作弊监测 — maksym_andr · 2026-09-14
- 作家实测:Gemini 查引文来源「稳定地」给错答案,两测两错 — danbri · 2026-09-14
- 开源插件 Astrable:让 GPT-6 Astra 指挥 Claude Fable 写代码 — daniel_mac8 · 2026-09-14