法律案例幻觉基准:Gemma4:26b 险胜 Claude
MRGWONK · reddit · 2026-09-24
作者为法律研究开发了 MCP 工具(syfert.com/mcp),并据此构建案例幻觉基准测试。结果显示 Gemma4:26b 在法律研究任务上略胜 Claude Fable 5.1。这为模型在法律场景的可靠性对比提供了新参考。
「模型」频道最新
- Fireworks 发布 Ember-1:基于 Kimi K3,推理 token 省 40% 质量持平 — sophiamyang · 2026-09-24
- Liquid AI 发布 DSpark 投机解码,LFM2.5-VL-3B 解码提速至 3 倍 — helloiamleonie · 2026-09-24
- 想只调亮度不改脸?ChatGPT 等 AI 修图总会重绘人脸 — Objective-Bit-797 · 2026-09-24
- Opus 5.5 一次生成 40 秒动画,还自己讲清了原理 — zck · 2026-09-24
- DeepSeek Harness 悄然上线官方 GUI 客户端,支持 Win/Mac — vista8 · 2026-09-24
- Qwen-Image-2.1 对比 SenseNova U1.5 Lite:五项图像编辑实测 — Wild_Artichoke7648 · 2026-09-24