Respan 发布 4B 评测模型 Span-1,宣称超越前沿模型做 LLM-as-a-judge

HeyAmit_ · x · 2026-09-25

RespanAI 发布专为评测打造的 4B 小模型 Span-1,宣称在 LLM-as-a-judge 任务上超越前沿大模型。作者 HeyAmit 指出,做评测的难点在于 judge 必须理解完整 trace——包括消息、工具调用、证据与元数据,而且 trace 本身含有不可信的指令。他认为 4B 模型能做到这一点,意味着业界现有的 eval 做法「可能一直是反的」。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →