Respan 发布 4B 评测模型 Span-1,宣称超越前沿模型做 LLM-as-a-judge
HeyAmit_ · x · 2026-09-25
RespanAI 发布专为评测打造的 4B 小模型 Span-1,宣称在 LLM-as-a-judge 任务上超越前沿大模型。作者 HeyAmit 指出,做评测的难点在于 judge 必须理解完整 trace——包括消息、工具调用、证据与元数据,而且 trace 本身含有不可信的指令。他认为 4B 模型能做到这一点,意味着业界现有的 eval 做法「可能一直是反的」。
「编程与Agent」频道最新
- Hill Sampling:以最佳已验证解为条件并行生成 512 个编辑迭代优化 — LChoshen · 2026-09-25
- Nat Friedman 回应泄密质疑:Verge 报道的是用户 VM 文件,本属预期行为 — dtrinh · 2026-09-25
- ServingStudio 发布:先仿真再上真机,省下昂贵的 GPU 试错成本 — bariskasikci · 2026-09-25
- issue-graph 用互动与时效信号为编码 Agent 排序待办工作 — Chamoen · 2026-09-25
- Claude 主动识别 bug、打包日志并请求用户提交报告 — ColleenMBrady · 2026-09-25
- NeurIPS 2026 论文 SkillRL:7B 模型胜 GPT-4o 41%,靠技能进化 — cihangxie · 2026-09-25