用单次前向表现近似预训练质量
RyanGreenblatt · x · 2026-07-17
Ryan Greenblatt 先说自己之前链接错了,随后补充:他用某个数据集做了快速实验,并以**单次前向推理的数学题表现**作为一个近似指标。 他解释这个指标并不完美,但能大致对应预训练质量;至少它不会被后训练改善。相比之下,loss 可能更好,但由于拿不到闭权重模型的 base,无法直接测 loss。
所属事件:研究者提出用数学单测评估预训练质量(2 条相关)→
「研究」频道最新
- Jina 发布 0.6B reranker,BEIR 表现对标 4B 模型 — _reachsumit · 2026-07-21
- Google Research 将模型路由变成可度量的多样性与稳定性问题 — burkov · 2026-07-21
- 可完全自托管的 agent 记忆栈:Hermes 加 Hindsight — blaizedsouza · 2026-07-21
- 新论文将 LLM 推理 GPU collective 延迟压到光速下限 7% 以内 — algo_diver · 2026-07-21
- 基于 GGUF 的 LoRA 训练把 Qwen3.5-35B-A3B 装进 16GB 显存 — woct0rdho · 2026-07-21
- 腾讯推出 Hyra-1.0,面向研究与工程任务的智能体 — bdsqlsz · 2026-07-21