实测 16/16 vs 9/16:作者提醒警惕 benchmark,用自己数据测

tobowers · x · 2026-09-22

作者用两个模型做「turn detection」(对话轮次检测)对比实验:基于微型 BERT 的 Laya 架构 vs Jev,结果 Jev 16/16 全对,Laya 大约只能对 9-10 个,接近随机掷骰子,且状态措辞稍有变化就可能完全失效。作者的结论是 Laya 本身是个不错的架构,但不要迷信 benchmark 成绩,一定要在自己的数据集上实测。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →