刑辩律师本地运行Qwen3处理涉密案卷,遭遇幻觉难题
Logical-Charge8760 · reddit · 2026-07-06
一位巴西刑事辩护律师因案件保密无法使用云端API,在RTX 4060(8GB显存)+32GB RAM笔记本上用llama.cpp部署Qwen3 35B-A3B(MoE)处理法律文书改编任务,但模型频繁以高置信度幻构法条引用。
其工作流为:从历史文书库中选最近模板,让模型替换事实细节、删除不适用段落、保留法律推理和引用。他寻求grounding、模型选择和RAG管线方面的改进建议,同时指出葡萄牙语(巴西)法律文本对小模型是额外挑战。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11