微软研究:LLM 天然就是 Jev 式决策模型,微调并非总是必要
microsoft · hf · 2026-10-07
微软提出 LLM-as-Jev 框架,研究通用 LLM 能否直接充当「Jev 式决策模型」——即在预定义选项上输出类别概率分布、供软件系统直接执行,而不生成自由文本。方法从括号数字标识符上的 next-token 概率中提取校准决策,同时提供免训练推理方案与微调目标(树因子化 listwise 损失,用 KL 惩罚锚定基础模型)。在 Qwen3.5-4B 和 Qwen3-0.6B 上的主要发现:
- 4B 模型免训练即可比肩同底座的社区 Jev 模型,优于 letter-logit 读出,支持任意选项数和图像多模态决策;
- 微调收益是定向而非普适的:显著提升弱模型和特定任务(如多选项意图路由),对强底座收益递减;
- KL 锚定可防止对话文本生成能力退化,LoRA 在强模型上表现最佳。
「研究」频道最新
- COLM 论文:潜空间推理模型的潜 token 多数可解码,可解释性即正确性信号 — sarahwiegreffe · 2026-10-07
- Apple ML 招聘研究实习生:让基础模型「知道自己知道什么」 — sineadwilliamso · 2026-10-07
- CAVEAT 测试台登场:商店促销能否带偏你的 AI 购物 Agent — ZacharyHuang12 · 2026-10-07
- GEA:以群体为进化单元的 Agent 自我改进范式,SWE-bench 71% — xwang_lk · 2026-10-07
- 9B 模型花 25 美元算力微调,达 Jev 决策指数 79% 分数 — sophiamyang · 2026-10-07
- 机器人学会「恢复技能」,真机任务成功率从 77.5% 升至 87.5% — qinzytech · 2026-10-07