Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄
b_roziere · x · 2026-10-09
Mistral 的 broziere 澄清 FrontierCode 评测的运作方式:这是一个私有评测,分数由 Cognition 计算,模型方无法访问其样本,所有模型均由 Cognition 侧运行。这为 FrontierCode 榜单成绩的可信度提供了背景说明。
「模型」频道最新
- Qwen3.5 2B/4B/9B 纯文本 MLX 4-bit 包发布,最小仅 1GB — sachasayan · 2026-10-09
- 多语言 LLM 为何难做:字符解码与 BPE 是隐形瓶颈 — ivan_bezdomny · 2026-10-09
- Anthropic 启动 Cyber Mission:用前沿模型守护电网与开源软件 — AnthropicAI · 2026-10-09
- 669 项临床决策仅花 1.7 美分,开源模型医疗成本惊人 — antoine_chaffin · 2026-10-09
- Emad Mostaque:OpenAI 解 Navier-Stokes 花掉千万美元算力 — rohanpaul_ai · 2026-10-09
- 马斯克站台 Grok Bot:可调用 Opus 5.5、全量访问 X 数据 — elonmusk · 2026-10-09