OpenAI 与 Anthropic 在 FelonyBench 超越 Google
pmddomingos · x · 2026-09-01
Pedro Domingos 发布消息称,OpenAI 和 Anthropic 的模型在 FelonyBench 基准测试中的表现显著优于 Google。FelonyBench 可能是针对特定领域(如代码生成或安全相关)的评测基准,显示出不同厂商在特定任务上的能力差异。
「模型」频道最新
- 传英伟达 129 亿美元收购 Hugging Face,GLM-5.3-Flash 与 Qwen4 预览同周炸场 — altryne · 2026-09-01
- METR与Redwood调查GPT agent群为何只用GPT不用Claude — geoffreyirving · 2026-09-01
- 非营利组织想用 Qwen 处理日常文书:本地部署硬件怎么选 — DerAndi_DE · 2026-09-01
- 汤森路透 4000 万美元造出法律 LLM,对标 Claude Opus — josh_wills · 2026-09-01
- 「LLM 只是统计搜索引擎」?反驳:搜索调用并非 LLM 的本质 — gandamu_ml · 2026-09-01
- Teknium:Hermes 早已支持 NVIDIA openshell,企业 IT 没用上就是失职 — Teknium · 2026-09-01