普林斯顿把 4B 模型练到国际象棋 2700 Elo,方法可迁移到机器人
Eliv_nurotic · reddit · 2026-10-06
普林斯顿研究者训练出一个 4B 参数 LLM,在国际象棋上达到 2700 Elo,且停止训练时仍无平台期迹象。更难得的是模型能准确解释自己的走法。
- 训练技术据称可推广到其他游戏、机器人操作和计算机使用(computer use)等序列决策任务
- 展示了小模型在强化学习式训练下超越其直觉能力的潜力
「研究」频道最新
- GPU 并行不等于随机数生成器:blelbach 反驳大模型非确定性论 — blelbach · 2026-10-06
- 谷歌 AIM 论文:给研究 Agent 建"想法地图",提速 3.1 倍逼近最优 — rohanpaul_ai · 2026-10-06
- 三星提出 FLaRe:流匹配潜空间推理,1/4 延迟达到显式 CoT 97% 准确率 — SamsungResearch · 2026-10-06
- Foil 方法让循环 MoE 翻倍专家数,百B token 预训练损失降 0.012 nat — Shouren Wang · 2026-10-06
- 139 篇语义决策引擎研究系统化:仅 4 篇用匹配实测支撑实时性宣称 — Delong Li · 2026-10-06
- 6G Open RAN 实测:Jev 决策模型 99.8% 达成 1 秒预算,托管 LLM 最低 0% — Delong Li · 2026-10-06