作者提醒:CRMArena-Pro 只读评测,不能代表全部企业工作
Shahules786 · x · 2026-09-03
Shahules 线程(4/6):CRMArena-Pro 的边界很清楚——评测是只读的,覆盖 19 个 CRM 任务,并不衡量企业工作的全部环节。这不削弱基准本身,而是告诉我们如何解读分数:只有当结论的边界明确时,评测结果才有意义。
所属事件:新基准 CRMArena-Pro 登场,探讨评测与真实工作的差距(4 条相关)→
「研究」频道最新
- DLCM 论文:从 token 转向概念建模,推理快至 3.3 倍 — burny_tech · 2026-09-03
- 牛津与 NUS 推出 V-RAE:用预训练视觉表征替代像素重建做视频生成 — jiqizhixin · 2026-09-03
- tokenbender:SWA 可视为现代线性注意力的特例 — tokenbender · 2026-09-03
- MazeBench 作者回应评测反馈:算法生成关卡对 agent 无效 — patience_cave · 2026-09-03
- AsyncGRPOTrainer 新增 LoRA 训练支持,FSDP2 实测跑通 — QGallouedec · 2026-09-03
- MazeBench 被传统求解器攻破,作者承认难度在感知不在搜索 — patience_cave · 2026-09-03