Qwen3.8-27B 人味 LoRA 2.0 发布:支持工具调用,盲测 23.5% 被判为真人

kvyb · reddit · 2026-10-03

作者发布了 Qwen3.8-27B-Humanlike-Chat 2.0(上一版获 700+ 赞、44k 下载),保留"像人发消息"的语气,同时修复 v1 被吐槽的缺陷:不调用工具、听不进指令、单一人格。

2.0 改进

训练方法:v1 是 139,845 条消息的纯 SFT,会复制坏习惯;2.0 改用 on-policy distillation——模型自写回复,由两个老师逐 token 打分("像人发消息"隐藏指令版 v1 负责聊天/角色,裸基座负责指令/工具/代码),学生看不到隐藏指令却学到行为。同样 27B 之上第二个 LoRA 合并。

数据:IFBench 37.3→43.7,When2Call 48→58,BFCL irrelevance 60→78;MMLU-Pro 和 LiveCodeBench 略降。自建 "ishuman" 盲测(150 段未见聊天补写、judge 二选一):基座 0.3%、加系统提示 6.8%、官方 Qwen3.8 15.1%、2.0 达 23.5%——证明光靠 prompt 到不了这个水平。16 场真人设多轮对话中 2.0 全胜基座。GGUF 与 LoRA 已上 Hugging Face。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →