模型评测基准已崩坏,急需标准化测试工具
omarsar0 · x · 2026-08-24
当前用专有 Harness 评测模型性能存在严重偏差,大厂通过工程优化刷分,导致结果不可比。作者呼吁建立类似“标准化考场”的通用测试环境。同时指出,未来模型可能动态生成测试用例,使评测边界更加模糊。
「模型」频道最新
- 观点:OpenAI与Anthropic押注原始智能,低价模型暂落后中国 — haider1 · 2026-08-24
- Gemini 3.7 Flash 在 Mario 基准测试中表现优异 — TheMoonMidas · 2026-08-24
- 实测:Qwen3.8:27B 本地移植 3.9 万行 C 代码完败 Opus 5 — codehamr · 2026-08-24
- DeepSeek API 8月23日起取消周末优惠价 — kimmonismus · 2026-08-24
- Gemini 3.7 Flash 上线 10 天涌现创意案例 — CodeByPoonam · 2026-08-24
- 消费级显卡跑大模型两年提速12倍,预测2027年游戏PC可本地运行前沿模型 — Yuchenj_UW · 2026-08-24