AutoBenchmark 后续:基准难度可迁移到未见过的新模型
jaseweston · x · 2026-09-30
AutoBenchmark 线程 4/5:在基准创建循环内部用 Muse Spark 和 Glimmer 作为解题者得到的基准,其难度可以迁移到未参与循环的 Nemotron 和 Claude Opus-5 上。迁移后趋势不变:有人类辅助的基准更有效,没有人类辅助时基准很快被刷饱和。
「研究」频道最新
- Cohere Labs 举办 IOL-AI 2026 总结会,复盘语言学推理基准为何仍难倒模型 — Cohere_Labs · 2026-09-30
- 英国 Zenithon 融资 1000 万美元,为火箭与核聚变造世界模型 — roydanroy · 2026-09-30
- Tenstorrent 开放生物模型训练:Blackhole Galaxy 性能接近 DGX H200,成本仅四分之一 — MoAlQuraishi · 2026-09-30
- MIT 新 AI 击败顶级 Stratego 选手,自博弈+决策时规划更省资源 — nordicinst · 2026-09-30
- 新研究:AI 当「导师」比当「替身」更聪明,用户表现反超 — CackleRooster · 2026-09-30
- 麦肯锡研究:AI 参与的候选药物将发现周期缩短约 15-80% — HealthcareAIGuy · 2026-09-30