Bindu Reddy:别再用 3D 游戏当模型基准,实验室都在定向微调
bindureddy · x · 2026-09-23
Abacus.AI CEO Bindu Reddy 呼吁 X 社区停止用「让模型做 3D 游戏」来评测模型:她指出各实验室其实正在针对这类用例做定向微调,因此跑出好成绩并不代表模型在复杂自动化或真实编码场景中真的更强。
「模型」频道最新
- NVIDIA 开源 Nemotron 3 Diarization,补上语音 agent 认人短板 — andimarafioti · 2026-09-23
- NVIDIA 发布 Nemotron 3 说话人分离模型,支持 8 人重叠语音 — NVIDIAAI · 2026-09-23
- 开发者吐槽 Anthropic 新安全检查:Opus 5.5 连代码审查都误拦 — evilsocket · 2026-09-23
- 深度对话中的最新模型满是术语跳跃:「更像在跟 AI 交谈而非人类」 — erikphoel · 2026-09-23
- Andrew Carr:Opus 5.5 可能是首个有点「创造力」的模型 — andrew_n_carr · 2026-09-23
- Anthropic 推出生命科学验证计划 LSVP,Opus 5.5 生物任务需审核准入 — _sholtodouglas · 2026-09-23