Llama 3.1 8B 微调医疗决策模型:逐字段准确率 84%,全对仅 30%
Forsaken_Cut8542 · reddit · 2026-10-05
作者训练一个辅助医生决策的 LLM 模型:输入含病史、主诉、体检结果的大文档,输出一组字段预测,目标是像人类专家一样凭上下文与模式发现错误。
技术方案
- HTML 表单解析为精简 Markdown,截断至 38k 字符适配 16k 上下文,去除日期/文档 ID,保留个人信息
- 基座: unsloth/Meta-Llama-3.1-8B-Instruct-bnb-4bit,QLoRA rank=16,unsloth 定制 DDP 与内存优化
- 27k 训练样本,单条指令,双 V100 16G 训练与推理
评测(1.5k 行、15k 字段留出集)
- 平均逐字段准确率 84%;儿童子集 80%
- 全字段全对仅 30-34%
作者求教如何提高「完美预测」比例,愿意尝试更大模型、全参微调或非 LLM 方法。
「模型」频道最新
- AI去噪图像分数相近,衍射斑点恢复率却大不同 — bravo_abad · 2026-10-05
- 70个开源复现决策模型同基准零样本分类成绩公布 — bibryam · 2026-10-05
- KOL 实测 GPT 操控 Safari:像真人一样用浏览器几乎不出错 — kimmonismus · 2026-10-05
- 用户称 6.1 Sol /high 档额度不错,吐槽 Codex remote 连接不稳 — rudrank · 2026-10-05
- 双 5070 Ti 跑 Ornith 1.5 35B-A3B:180 tok/s,速度为 Qwen 27B 的 3 倍 — Excellent-Issue-5956 · 2026-10-05
- ChatGPT 将合并 Chat 与 Work 并移除模型选择器,用户酝酿退订 — Diamond_Mine0 · 2026-10-05