MathArena 实测:4 个 agent 花费 500 美元写博客,仅 Opus-5.5 达标
ChrSzegedy · x · 2026-10-09
MathArena 团队做了一个实验:给四个 LLM agent 各 48 小时和 500 美元 API 额度,让它们为 MathArena 写一篇有趣且新颖的博客文章。结果是 GPT-6 Astra、GPT-6.1 Sol 和 GLM-5.3 产出的都是低质「slop」,只有 Opus-5.5 写出了包含有趣结论的合格博客。
「模型」频道最新
- Gemini 4 Argon 现身 Google 自家模型选择器,发布会在即 — vedantmisra · 2026-10-09
- ChatGPT 桌面版自封 CSV 默认打开方式遭用户吐槽 — generativist · 2026-10-09
- LightOnOCR-3 训练数据详解:MinHash 去重加公式表格加权采样 — IgorCarron · 2026-10-09
- LightOnOCR-3 用多目标 RLVR 同步优化文档定位、OCR 与空页处理 — IgorCarron · 2026-10-09
- 文档 grounding 训练难在标注:LightOn 用多 OCR+布局检测器建管线 — IgorCarron · 2026-10-09
- 不用 HTML 输出坐标:紧凑标记让 grounding 少耗 9–14% token — IgorCarron · 2026-10-09