学者提醒:应假设所有公开基准测试都在撒谎
yacineMTB · x · 2026-08-18
Astir Wilde 再次提醒,人们应假设所有公开的基准测试都在撒谎,且大多数学术研究比毫无用处更糟。
「模型」频道最新
- 普林斯顿学者详解:LLM 无失真水印为何可能,多数人误解了生成机制 — soumitrashukla9 · 2026-08-18
- Qwen3.8-27B 登顶 HF 历史第三,超越 Kimi-K3 — multimodalart · 2026-08-18
- 多模型实测:Gemini 推理称王,GLM 5.2 开源性价比高 — iamsatvik20 · 2026-08-18
- GPT5.6 Sol 仍难以处理含下划线的变量名 — StephanSturges · 2026-08-18
- GLM-5.2 夺冠,Qwen 3.8 跑分提速 214% — yacineMTB · 2026-08-18
- Hugging Face开源模型突破300万,社区加速开放 — multimodalart · 2026-08-18