公开基准或将大幅贬值:你的基准就是你的秘方
sarahcat21 · x · 2026-09-25
作者判断:公开 benchmark 的数量乃至价值都可能急剧下降。越来越多从业者意识到,基准本身就是竞争力(secret sauce),而且很难设计出「通用」的前沿任务——对你特定用例而言的前沿,和泛泛的前沿是两回事。这暗示私有评测集将取代公开榜单成为衡量模型实际价值的依据。
所属事件:OpenAI 前高管:公共基准价值将大幅缩水(2 条相关)→
「模型」频道最新
- 网传 ChatGPT 定价全线上移:$20 沦为新免费档,$500 对应旧 Pro 20x — haider1 · 2026-09-25
- Nace Drex 模型实时直播打《毁灭战士》,剑指 Jev — DotaMate · 2026-09-25
- 博主实测:Opus 5.5 创意写作惊艳,Astra 综合更强 — RyanMorrisonJer · 2026-09-25
- AI 在 Mensa 挪威智商测试拿到满分 151,Musk 转发感叹 — elonmusk · 2026-09-25
- GPT-Sol 输出中文非重度量化所致,实为语言混淆与采样器浮点问题 — AryHHAry · 2026-09-25
- TypeSafe 推出 Jev:校准置信度、约束输出格式的新模型 — tech_technical · 2026-09-25