B站「AI无限竞技场」:190个视频真实任务实测100多个模型
vista8 · x · 2026-09-20
AI 自媒体 vista8 讨论大模型评测困境:传统 Benchmark 因刷榜、题目污染和奖励黑客逐渐失效,普通人看懂的演示(鹈鹕骑自行车、3D 游戏、精美 PPT)又偏炫技。他主张真实场景一镜到底实测——看用什么 Harness、什么 Prompt、OneShot 质量与迭代效果。
他推荐 B站的「AI无限竞技场」活动:让 UP 主用真实任务测模型,题材横跨编程、量化交易(看谁真赚钱谁亏穿)、狼人杀博弈、3D 白模生成的性价比等。
- 作者写爬虫抓取了全部参赛作品放到 GitHub:40 个主题、190 个视频、33 位 UP 主,参赛模型 100 多个
- 他体感当前排名:第一 GPT6-Astra、第二 Fable 5.1、第三 GLM-5.3
- 听说 Gemini4、Grok4.7 即将发布,格局可能变化
所属事件:B站AI无限竞技场 190个视频实测百余模型(2 条相关)→
「模型」频道最新
- Burkov 质疑斯坦福 AI Index:美国 59 个知名模型被高估 — burkov · 2026-09-20
- JEV 引入国内观察者:不说话、直接输出类型化概率决策的模型 — sven_ai · 2026-09-20
- JEV 引发热议:模型规模、校准可靠性与微调接口成待解问题 — vykthur · 2026-09-20
- 北京创业公司 Naive AI 本月将发布首个大模型,加入国产 LLM 竞赛 — pstAsiatech · 2026-09-20
- 一句话梗:post-training 就是把 base 模型变得不那么 based — panickssery · 2026-09-20
- 「Jev 不是 LLM」引争论:BERT 系也是语言模型,零样本分类器被低估 — RexDouglass · 2026-09-20