RSI-Exam 榜单:Claude Opus 5.5 以 0.536 登顶力压 GPT-6

HuaxiuYaoML · x · 2026-10-02

评测方式:agent 需进行数小时自主实验(优化解题方法或驱动冻结模型的 harness),最终在隐藏测试集上一次性评估。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →