本地模型评测基准集合网站上线:30+小基准,支持自定义评测
EmilPi · reddit · 2026-08-02
Reddit 用户 EmilPi 分享了他构建的本地模型评测基准集合网站(beta.locallm.top),旨在解决本地模型评测缺乏领域特定基准的问题。网站支持创建基准(含查询集)、创建模型/系统提示组合(称为 Pipeline)、评估回答并查看对比表格。目前已有 10+ 个窄领域基准(每个含 5-18 个问题,由领域专家创建,涵盖食品安全、激光物理、无线网络、英国文学、心理学等)和 25+ 个小型基准(2-4 个查询,质量参差)。作者还提出了多个待改进方向,如多轮对话评估、加权平均分、RAG/结构化输出/Agentic 等 Pipeline 类型,以及是否支持音频转录/图像理解基准等。
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24