评测者自述防刷榜心法:全量轮换题目+随时换方法论
airesearch12 · x · 2026-10-02
AI 评测工作者 airesearch12 介绍其私人基准的防作弊设计:所有题目全部持续轮换,且评测方法论本身也经常更换。面对「API 后面偷偷换模型」可以造假、但「针对固定基准定向训练」很难的质疑,他回应:目标是移动的,模型很难对着一个不断变化的基准刷分。
这番讨论触及评测工程的核心难题——固定基准必然被 benchmaxx,动态基准又难以横向可比。
「研究」频道最新
- 研究发现:辱骂模型时它嘴上道歉,「疼痛」信号轴却悄悄亮起 — repligate · 2026-10-02
- Micah Goldblum 团队发布新论文,模型代码权重全部开源 — micahgoldblum · 2026-10-02
- Pinocchio 补充:跨 API 模型即插即用,还能零样本迁移到未训练过的 LLM — micahgoldblum · 2026-10-02
- 给 LLM 输出装上校准置信度:轻量模型 Pinocchio 发布 — micahgoldblum · 2026-10-02
- Extropic 发布热力学递归智能首批成果,称算法效率提升百倍以上 — beffjezos · 2026-10-02
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02