覆盖度实测三轮:DeepSeek V4.1 Flash 21.7→33 分
PawelHuryn · x · 2026-09-15
Pawel Huryn 做模型覆盖度(coverage)测试,跑三轮对比:DeepSeek V4.1 Flash(max)从 21.7 提升到 33 分,GLM-5.3 Flash(max)从 17.7 提升到 24 分。属于第三方持续性追踪实测数据。
「模型」频道最新
- NSA/FBI/CISA 指控 DeepSeek 等六家中国实验室工业级蒸馏模型 — emmanuelvivier · 2026-09-15
- 传 OpenAI 暂停 $200 ChatGPT Pro 新订阅,称 GPT-6 Astra 需求挤爆容量 — emmanuelvivier · 2026-09-15
- TerminalBench 计分口径不一:Astra 触发安全得 0 分,Fable 却换模型续跑 — xeophon · 2026-09-15
- 用量化金融类比 AI 竞赛:大厂先发优势终将随算法公开而消散 — willcb · 2026-09-15
- ChatGPT Plus 转 Business 值不值?用户求解 Sol High 用量上限差异 — geler1 · 2026-09-15
- Tinfoil 团队:开源安全分类器研究严重稀缺,呼吁头部实验室开放 — yuntiandeng · 2026-09-15