MirrorCode 榜单加入 Gemini 3.1 Pro 评测
scaling01 · x · 2026-08-12
MirrorCode 编程能力排行榜已加入 Gemini 3.1 Pro 模型。该评测任务规模庞大,单次尝试提供高达 100 亿 token 的预算及 7 天的时间限制,更多模型的评测结果将在运行完成后陆续公布。
「模型」频道最新
- 用户指责 Anthropic 评测数据造假,实际体验缩水 — GabGarrett · 2026-08-12
- 前沿大模型思维链加密遭破解,衍生新型提示词注入攻击 — Simon Willison · 2026-08-12
- GPT 与 Claude 实测:谁更懂你的意图? — nickbaumann_ · 2026-08-12
- 专家担忧AI水印推高代码熵值,呼吁警惕编码智能体输出 — wightmanr · 2026-08-12
- e/acc创始人指Grok正形成日常使用趋势 — beffjezos · 2026-08-12
- Kimi K3 蒸馏争议:论文作者承认未证实,或为数据污染 — bookwormengr · 2026-08-12