研究者称 TypeSafe 的 Jev 抽象与其 8 个月前 Autorubric 论文高度相似
deliprao · x · 2026-09-21
Delip Rao 发文称,调查 @typesafeai 新产品 Jev 后发现其使用了与他 8 个月前发布的 autorubric 框架极为相似的抽象——后者即将在下月 COLM 会议上正式报告。他指出 Jev 的 Noul/Score/Choice 准则类型与 Autorubric 论文(arXiv:2603.00077)中的 criterion types 一一对应。Autorubric 是一个开源的基于评分准则(rubric)的 LLM 评测统一框架,针对不可程序化验证的任务,提供统一的评测 API,支持混合准则类型的原子化评测、位置偏差等校准、弃权机制与心理测量学诊断,并附带 CHARM-100 聊天机器人评测基准。这篇帖子既是对 LLM-as-judge 评测方法的科普,也暗含对创意归属的质疑。
所属事件:研究者指 TypeSafe 的 Jev 抄袭其 AutoRubric 论文抽象(3 条相关)→
「研究」频道最新
- 学者呼吁建 AI 主导的科学期刊:投稿评审策展全交给 AI — anshulkundaje · 2026-09-21
- Waypoint Bio:AI 制药的瓶颈在数据而非模型 — anshulkundaje · 2026-09-21
- 研究估算:LLM 出现后美国自然失业率升约 0.1-0.2 个百分点 — mattbeane · 2026-09-21
- JevBench 开源:专注类型化决策模型的评测基准 — sull · 2026-09-21
- gLM2 设计 2500 氨基酸聚酮合酶,尼龙前体产量提升约 10 倍 — anshulkundaje · 2026-09-21
- 开发者用 5 万条 SWE-bench 运行数据训练「世界模型」辅助编码 Agent — Decent-Ad9950 · 2026-09-21