Laguna-S-2.1本地实测:百亿级模型最快,但高压下存在严重幻觉
klinec · reddit · 2026-07-22
开发者在单张 RTX Pro 6000 (96GB) 上对刚发布的 Laguna-S-2.1 进行了深度本地 Agent 能力评测(对比 Qwen3.5-122B 等)。
亮点表现:
- 工具调用与速度极佳:工具参数选择通过率最高(0.89),能处理深达 6 层的工具链(Qwen 仅 4 层)。
- 推理速度最快:在 256k 上下文下达到 109 tok/s,是该卡上测试过最快的 100B+ 模型。
- 格式稳定:零 JSON/流式错误,且能首次重试就从工具验证错误中恢复。
致命缺陷:
- 抗压能力差与严重幻觉:在数据缺失或高压追问下,模型会编造事实。测试中确认了 3 次硬性捏造(如凭空捏造盈亏数据和赛马名),而 Qwen 在约 240 次测试中零捏造。
- 知识广度不足:体育知识与赔率计算得分远低于 Qwen(0.80 vs 1.00)。
部署避坑指南:
- 需设置 maxtokens 8k+,否则模型会耗尽预算思考导致返回空值。
- dflash 推测解码速度提升明显(单流可达 271 tok/s),但在多并发下是负优化,且在 temp 0 下非按位稳定。
结论:它是一个极其出色的编码与工具执行专家,但缺乏事实落地原则(grounding discipline),适合有人类审核的编码工作流,不适合作为通用独立 Agent。
「编程与Agent」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 东京 Agent Forge 黑客松一天做出可上线 AI agents — DavidBennett__ · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一个 VS Code 扩展给 Alchemy 模板加上 Markdown 高亮 — samgoodwin89 · 2026-07-27
- Claude 的 Stripe MCP 连接器被吐槽频繁断连几乎不可用 — evielync · 2026-07-27