合规场景实测:Luna 6 检错表现远超上代,可替代 Mini 5.4
Babayaga1664 · reddit · 2026-10-02
一位从事合规审查的开发者分享了实测:团队用模型对照法规检查最多 20 万词的纯文本文档,此前用 Mini 5.4。
实测结论:
- 新发布的 Luna 6 表现「相当不错」,明显好于此前表现糟糕的 Luna 5.6;
- 用更贵的 sol-6 建立基线,Luna 6 在对照检查中找出了此前漏掉的新错误;
- Luna 6 部分场景下过于严格,但通过少量 prompt 调整后表现很好,而 sol-6 对这个用例来说成本过高。
「模型」频道最新
- 零样本分类模型被改叫「决策模型」,HF 工程师称没想到 — mervenoyann · 2026-10-02
- 开发者吐槽 Claudebot 爬虫日访问其网站超 28 万次 — TejasKumar_ · 2026-10-02
- 开发者发布 Qwen3.8-Flash 低比特量化:保留 95% 精度且长上下文不衰减 — Crampappydime · 2026-10-02
- 真采用率才是模型评测:一线员工高压下不用,跑分归零 — diegoposts · 2026-10-02
- 单卡 R9700 跑 Qwen3.8-Flash-Next:230k 上下文下 863 t/s prefill、35 t/s 解码 — Designer_Elephant227 · 2026-10-02
- Mercor 研究:AI 会计任务速度精度超越持证 CPA,但仍无法独立结账 — The Decoder · 2026-10-02