开发者开源「无偏」大模型评测基准
cephaloform · x · 2026-07-31
针对当前模型评测基准难度过高或容易饱和的问题,开发者开源了其内部使用的评测基准。
- 该基准主打「无偏」测试,旨在提供更客观的模型能力评估。
- 支持 🤗 Transformers、OpenAI 兼容的服务端以及 .gguf 格式,可通过 pip 快速安装使用。
「研究」频道最新
- 研究揭示简单图像变换即可绕过主流AI内容审核系统 — chaumian · 2026-07-31
- Pangram-4 技术报告:用 Repeat2 等技巧训练 SOTA AI 文本检测器 — RexDouglass · 2026-07-31
- 中科大等提出视觉预训练新范式:仅用 1/4 Token 超越纯文本 — 量子位 · 2026-07-31
- Kimi K3 架构解析:用「主动遗忘」打造 2.8 万亿参数开源模型 — AccBalanced · 2026-07-31
- 神经符号AI中的推理捷径:一篇历时三年的综述论文 — tetraduzione · 2026-07-31
- ShadowDancer:用“影子对”教视频世界模型学任意动作 — AlayaLab · 2026-07-31