免微调复现 Jev:读 true/false logits,27B 达 75.5% 准确率
Malfeitor1235 · reddit · 2026-09-21
开发者 VakeDomen 发布 DIY-Jev:不用 NLI 微调或分类头,用完全未修改的开源权重模型做 Jev 式推理验证。
方法:把每个候选答案转成布尔判断——拼接 <state>/<question>/<options>/<candidate> 后,不生成文本,直接读取 true/false 的 logits,对每个候选求差再 softmax(昂贵的前缀只算一次,候选分支仅末尾 token 不同,批量过 llama.cpp)。
32,235 例基准成绩(笔记本 RTX 5090 24GB):
- Qwen3-4B:65.0%,约 27 req/s
- Qwen3-27B:75.3%,约 2.9 req/s
- Qwen3.6-35B-A3B:75.5%,约 5.3 req/s
有意思的结论:不训练任何东西、只靠读 logits,同一模型可超过 OpenJev 的微调版。作者声明不保证严格复现 Jev、基准也非完全对齐,但展示了「零训练调提示」的上限。代码开源于 GitHub DIY-Jev。
「研究」频道最新
- Anvil 团队组合式形式化验证 Kubernetes 控制平面 — tianyin_xu · 2026-09-21
- ReCouPLe 用语言理由做几何约束,奖励模型分布偏移下精度提升1.5倍 — burny_tech · 2026-09-21
- kalomaze:两位同行撞上多模态墙后,他改观了「借 SSL 特征」一事 — kalomaze · 2026-09-21
- 仅两个腕部相机,机器人闭环空间理解演示惊艳 — ChongZzZhang · 2026-09-21
- DeepMind 天气模型直接吃原始卫星辐射数据,逐小时同化预报一体 — burny_tech · 2026-09-21
- Agent 集群一天攻破多年人工密码分析难题,引密码学界热议 — thomasahle · 2026-09-21