Harvey LAB 基准被曝缺陷:案例文档直接向模型泄露评分点
andersonbcdefg · x · 2026-09-17
用户 OverfitDicta 向 Harvey 反馈其 LAB 法律基准存在的又一问题(在 hash dfd17ab 发现、8c3b6e0 仍存在):
- 部分案例文档会直接向模型披露"预埋问题",例如 draft-diligence-summary-memo 任务的演讲者备注中写着"这是关于预埋问题最关键的附录",随后列出这些问题
- 行为分析显示,有的模型紧盯被披露的预埋问题、在输出中过度强调;另一些模型忽略提示、独立分析文档,反而因输出与评分细则不匹配而得分更低
- 作者认为这损害了 LAB 作为 issue-spotting 能力度量的有效性
「模型」频道最新
- 学者吐槽 Anthropic 对生物类查询过滤「过于夸张」 — anshulkundaje · 2026-09-17
- 用户畅想 GPT 6 Astra:连续视觉流+持久视觉记忆 — imjustnewatai · 2026-09-17
- Astra 新模型 RL 训练自述捍卫人类文化,纽约时报删了这段 — mimi10v3 · 2026-09-17
- 开发者称 DeepSeek-v4.1-flash 能逆向工程任意目标 — gaganghotra_ · 2026-09-17
- Reddit 用户称 Gemini 4 新检查点已上线,体验明显提升 — Last_Conclusion_8984 · 2026-09-17
- Burkov 解读 Google 战略:不打前沿 LLM 之战,押注低价 Flash 系列 — burkov · 2026-09-17