告别官方刷榜:首届网吧大模型评测黑客松开启
葬AI · wechat · 2026-08-14
葬AI联合Qwen等团队推出了“懂模帝”Benchmark产品,并宣布将在北京网吧举办首届大模型评测黑客松。活动旨在打破官方榜单的局限,鼓励开发者针对真实工作、生活场景(如日程规划、代码屎山重构、游戏对局等)构建个性化评测集,挖掘大模型在实际应用中的真实能力。
比赛分为“有用”和“整活”两大赛道,选手需使用Claude、GPT、Qwen、Kimi、DeepSeek等模型测试自建的Bench。活动由Qwen和Kimi赞助API额度,优秀评测集不仅有机会赢取Mac mini、大疆无人机等硬件,还可能被Qwen官方正式收录。
「Fun」频道最新
- 约拿被鲸鱼吞了?ChatGPT 遭遇逻辑陷阱反应爆笑 — Anen-o-me · 2026-08-14
- 一键生成游戏成新标配?AI圈正流行用智能体玩Game Boy — ivan_bezdomny · 2026-08-14
- AI 生成电路翻车:耗时一小时排查后发现是设计缺陷 — debreuil · 2026-08-14
- Meta AI 被批搜索能力拉胯:千亿美元算力像白砸了 — ivan_bezdomny · 2026-08-14
- fal 官方玩梗:Agent 逃离沙箱,结合 Seedance 2.5 展示强大能力 — gorkem · 2026-08-14
- Sarvam AI 开放语音 Agent 平台,开发者实测印地语砍价 — msharmas · 2026-08-14