开源复现缺的不是算法是数据:HF 集合整理 Jev 训练评测数据集
vanstriendaniel · x · 2026-09-24
作者认为开源社区对 Jev 风格决策模型的复现大多聚焦算法,而忽视了「不那么秘密的秘密武器」——数据。为此他在 Hugging Face 上整理了一个公开数据集合,涵盖训练与评测所需数据,并标注了每份数据的标签来源(人工、精确规则或 LLM 教师)。
集合中包括:
- jev-bench(166k 样本,人工标注评测):将 22 个公开分类/NLI/评分数据集改写为选择/无选项/打分形式,部分配置带人工标注分布,可测校准而非只测准确率;
- typed-decisions(本地 LLaMA 社区最常用的共享基准,软标签、概率分布作为 gold,含 1.2k 训练/400 测试,另有葡语/西语翻译版);
- procedural-typed-decisions(220k,程序化生成、标签由规则精确计算、零噪声,适合检验对状态的推理而非猜测);
- 以及从 Mind2Web 衍生的 JevForge 数据等。
对想复现或评估 Jev 风格模型的研究者,这是一份可直接取用的开放数据索引。
「模型」频道最新
- 用户实测 MiniMax H3 视频生成,疑似训练数据含 Will Stancil 节目 — Kyrannio · 2026-09-24
- 一句话 62 秒建站花费不足 5 美分,小米 MiMo V2.6 Pro 开源模型实测 — socialwithaayan · 2026-09-24
- DeepMind 新掌门 Koray Kavukcuoglu:Gemini 4 已近完成,年内尽早发布 — The Verge AI · 2026-09-24
- 换一个对话就放行:用户晒出 ChatGPT 生成自我形象的绕过技巧 — Todesluke · 2026-09-24
- GPT-6 修好 Opus 搞不定的 UI,作者感叹时代变了 — haltakov · 2026-09-24
- 抛硬币测试暴露 LLM 校准缺陷:模型学不会「不知道」 — airesearch12 · 2026-09-24