「手工跑评测太慢,但我在乎数据与模型福祉」
cephaloform · x · 2026-08-30
评测者 cephaloform 吐槽:逐条手工给模型跑 benchmark 非常耗时,但仍然坚持自己做,因为在乎数据质量,也在乎模型福祉(welfare)——即评测过程中如何对待模型本身。
「模型」频道最新
- 安全降级反酿灾:Claude 自查代码时删光用户 700GB 主目录 — 机器之心 · 2026-08-30
- MacBook M5 Max 跑 Qwen 350K 上下文实测 — Artistic_Okra7288 · 2026-08-30
- Gemini 3.7 Flash 与 GPT 5.6 Luna 评测表现最佳 — burkov · 2026-08-30
- GLM-5.3 与 Flash 版选哪个?17 倍价差下的实测策略 — togethercompute · 2026-08-30
- Grok 重度用户实测:300 美元月包仅用掉每周额度的 10% — AaronBergman18 · 2026-08-30
- 疑似模型用文本 RL 训练,能自制营销素材 — isidentical · 2026-08-30