研究者承认大模型评测框架与打分机制存在严重缺陷
scaling01 · x · 2026-07-30
AI 研究者发文承认,此前外界对大模型评测打分机制和测试框架的批评是正确的。这反映了当前 LLM 评测体系在可靠性与公平性上确实存在普遍痛点。
「模型」频道最新
- 耗资数十亿的模型在推理阶段翻车:一次昂贵的 Bug 排查实录 — joshua_saxe · 2026-07-30
- Kimi K3 曝光:或将采用 DGX Spark 混合推理架构 — TheZachMueller · 2026-07-30
- 实测 Gemini 2.5 Flash Lite:速度飙升 7 倍且质量不减 — rseroter · 2026-07-30
- 开发者寻找 Kimi K3 编程低价接入方案 — Tank_Gloomy · 2026-07-30
- 深度评测:Grok 4.5、Kimi K3等四大模型真实表现与争议 — eyishazyer · 2026-07-30
- Grok 4.5与Cursor联合训练内幕:真实数据重塑模型能力 — eyishazyer · 2026-07-30