网吧黑客松横评:Qwen 物理工程强,K3 综合智力优
葬AI · wechat · 2026-09-01
「懂模帝Bench」黑客松在网吧举行,选手们设计了 30 个非编程类 Bench,揭示了模型在物理模拟、嵌入式驱动和德州扑克博弈中的真实水平。
嵌入式底层驱动能力:
- Qwen 3.8-Max:两道题均表现第一,展现出极强的系统级 Agent 能力(读手册、逆向、闭环修复)。
- DeepSeek:简单题全过,复杂 DMA 场景在状态机闭环时失败。
- Opus 5.0:代码质量与理解力最强,但隐藏压力场景下稳定性不足。
物理理解 Bench(无人机、机械臂、切割等):
- Qwen:总分最高,是唯一能稳定完成无人机飞控的模型。
- GPT:吸盘搬运完胜,其余表现稳定。
- K3:物理直觉强(材质抓取第一),但交付纪律弱(无人机全坠毁)。
- 结论:没有模型在物理场景全知全能。
德州扑克(破壁者 Bench):
- K3:利用行为线索判断最佳,不盲目跟注。
- Qwen:打法过于保守,加入视频模态后胜率反而下降。
总体来看,Qwen 训练数据丰富,在工程物理场景表现突出;K3 在多模态与综合智力上占优。大模型目前仍是「编程专精」,离 AGI 尚远。
「模型」频道最新
- Z.ai 推出 GLM-5.3-Flash:320B 参数、支持百万上下文与 NVFP4 量化 — alejandroll10 · 2026-09-01
- 传 GPT-6 已近人类计算机操控水平 — jYtanYj · 2026-09-01
- 开源模型转向非商用许可,后训练授权或成千亿市场 — zephyr_z9 · 2026-09-01
- 有人试过让模型只用 E-Prime 运作吗 — cephaloform · 2026-09-01
- 重度用户抱怨 Claude 近一周质量明显下滑:急于执行、不再追问需求 — Numerous_Leopard_522 · 2026-09-01
- SGLang新增支持DeepSeek-V4-Flash-Vision-Exp,附部署指南 — ying11231 · 2026-09-01