ARC-AGI-3官方开源基准测试代码库

针对近期关于Claude Opus在ARC-AGI评测中涉嫌违规的争议,Greg Kamradt出面澄清,表示测试中对Anthropic和OpenAI均采用了相同的滑动窗口。同时,ARC Prize官方在GitHub上开源了ARC-AGI-3基准测试工具库,以帮助评估前沿大模型的复杂抽象推理能力。此外,Kamradt还专门说明了API中reasoning字段的使用误区,指出其仅用于记录模型输出而非获取内部推理过程。

2026-07-30 ~ 2026-07-30 · 4 条相关

事件全程(共 2 集)→