阿里 HSCodeComp 基准显示 AI 仍远逊于关税专家
jiqizhixin · x · 2026-07-29
阿里巴巴提出了 HSCodeComp 基准,用来测试 AI 能否根据商品信息和关税规则,推断出精确到 10 位的 HS 编码。
- 这个任务要求模型像律师或医生一样,按层级规则逐步判断:先看大类,再处理更细的例外条款。
- 结果并不乐观:最强 AI agent 只有 46.8% 准确率,而人类专家达到 95.0%。
- 论文还发现,增加更多推理步骤不一定有帮助,反而可能让模型越走越偏。
- 这是一个面向真实规则推理场景的、偏专家级的评测基准。
「研究」频道最新
- 一个 AI 摘要系统每周扫描 92 个期刊并生成 RSS — Afinetheorem · 2026-07-29
- 一个每周更新的 PDB 排行榜追踪开源 cofolding 模型 — rishabh16_ · 2026-07-29
- Agentic AI 峰会设机器人与世界模型专场 — dawnsongtweets · 2026-07-29
- 新指南指出,系统性文献综述里 GenAI 仍需要人工监督 — DrDatta_AIIMS · 2026-07-29
- Wharton 实验室开源 AIBO,用于统计有效的 AI 行为实验 — emollick · 2026-07-29
- 一个 Unity RPG prompt,把多智能体循环推到 AAA 级极致 — chongdashu · 2026-07-29