6 个 LLM PK 97 格标注数据:漏提取的锅在 ASR 不在模型
Sufficient_Flower860 · reddit · 2026-09-30
作者用一段真实生产管线(视频 ASR 转写 + LLM 抽取结构化对赛记录)横向测试了多个模型的抽取能力,金标准为 6 个视频、97 个人工标注格子,温度 0、走真实校验逻辑。
主要结果
- Gemma 4 31B:最大视频 23/30,单视频耗时约 14.6 分钟,速度直接出局。
- DeepSeek V4 Flash(周末半价):71/97 = 73.2%,一个视频满分但耗时 690s,又慢又漏。
- Gemini Flash 系列(AI Studio 免费层,5 rpm / 20 rpd):3.x 各版本大面积 503,3.7 只有 1 个视频跑完(29/30)。作者让 Claude 写了个轮询脚本,证实所有版本都间歇可用,纯粹是配额和路由问题。
- 本地 CLI + Google One Pro:gemini-3.6-flash 达 84/97 = 86.6%(约 25s/视频);3.7 和 3.8 都拿 91/97 = 93.8%,逐视频分数和错误完全一致,但 3.8 慢 5-6 倍。3.7 开高推理反而略降(90/97)且更慢。
关键洞察:3.6、3.7-medium、3.7-high 在同一个视频上都漏掉同样的 4 格——当错误在不同模型、不同推理档位上纹丝不动时,信息很可能根本不在转写文本里,瓶颈是 ASR 分段切断而非 LLM 抽取能力。最后几个 miss 全是语音识别把模型名转错所致。
「编程与Agent」频道最新
- EpiCon:多智能体共享多模态记忆库,11 项基准平均提升 1.7-4.9 分 — Ziyun Zeng · 2026-09-30
- EngiWorld 基准:最强模型工程软件得分仅 44.3,跨软件任务成功率 3.6% — zhiman-ai · 2026-09-30
- xLLM 训练推理基础设施全套开源,含 xattn 与 xBridges — HongyiWang10 · 2026-09-30
- 120 张 B300 跑自动内核研究循环,6 小时为 Kimi K3 提效 40% — bookwormengr · 2026-09-30
- RSIArena 实验:8 个 agent 共享 64 张 Blackwell,各用 1000 GPU 时训模型 — my_cat_can_code · 2026-09-30
- GDE 开源免费 AI 工程课:500+ 课 340 小时,从裸数学写到智能体 — ghumare64 · 2026-09-30