实测 16/16 vs 9/16:作者提醒警惕 benchmark,用自己数据测
tobowers · x · 2026-09-22
作者用两个模型做「turn detection」(对话轮次检测)对比实验:基于微型 BERT 的 Laya 架构 vs Jev,结果 Jev 16/16 全对,Laya 大约只能对 9-10 个,接近随机掷骰子,且状态措辞稍有变化就可能完全失效。作者的结论是 Laya 本身是个不错的架构,但不要迷信 benchmark 成绩,一定要在自己的数据集上实测。
「编程与Agent」频道最新
- 开发者分享站点安全技巧:记录全部端点请求识破暴力破解 — Kyrannio · 2026-09-22
- 「2030 年所有主流软件都将被形式化验证」引发激辩:遗留债务是最大障碍 — luislamb · 2026-09-22
- 开源电脑协手 OpenMuse:一次性 Linux 桌面里替你浏览操作网页 — aniketmaurya · 2026-09-22
- 接入新 LLM 供应商前要检查哪些项?工程师团队的经验清单 — Rama_Surasani_ · 2026-09-22
- 开发者亲历:AI 写产品开发快到让人难以置信 — omnivaughn · 2026-09-22
- OpenAI 案例:V7 用 Context Graph 给企业 Agent 装上长期记忆 — xiaohu · 2026-09-22