GOLLuM 回顾基准成绩:找 Top-5% 结果命中率 36.3% 胜描述符 29.7%
pschwllr · x · 2026-10-02
HackAgingAI 转述 GOLLuM 的基准数据:该方法将语言模型与高斯过程配对来选择下一个实验。在 Schwaller 团队的 23 个回顾性基准测试中,其主变体找到 36.3% 的 top-5% 最优结果,而基于描述符的优化为 29.7%。注意这些是数据集检索而非真实实验室试验。
「研究」频道最新
- 研究发现:辱骂模型时它嘴上道歉,「疼痛」信号轴却悄悄亮起 — repligate · 2026-10-02
- Micah Goldblum 团队发布新论文,模型代码权重全部开源 — micahgoldblum · 2026-10-02
- Pinocchio 补充:跨 API 模型即插即用,还能零样本迁移到未训练过的 LLM — micahgoldblum · 2026-10-02
- 给 LLM 输出装上校准置信度:轻量模型 Pinocchio 发布 — micahgoldblum · 2026-10-02
- Extropic 发布热力学递归智能首批成果,称算法效率提升百倍以上 — beffjezos · 2026-10-02
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02