AI评测设计领先实际训练半年,闭源模型将利用所有漏洞
xeophon · x · 2026-08-10
作者指出,AI模型评测(eval)的设计与修复可利用漏洞的进度,通常比实际训练中遇到相同问题领先3到6个月。这反映了开源与闭源模型之间的滞后差异,闭源模型可能会利用它们发现的所有漏洞。
「模型」频道最新
- 传谷歌已悄然取消 Gemini 3.5 Pro 研发 — Left-Hotel904 · 2026-08-10
- Qwen 3.8 Max 评测高分遭疑,用户实际办公体验未达预期 — DavidOrzc · 2026-08-10
- Grok Imagine 2.0发布,图像生成榜单跃居全球第二 — eyishazyer · 2026-08-10
- Anthropic API 严控模式遇 $ref 会输出自相矛盾结果 — Nearby_Yam286 · 2026-08-10
- ChatGPT 协助代数拓扑研究,复活冷门前沿领域 — AlexKontorovich · 2026-08-10
- 用户反馈 Claude Opus 模型出现严重偷懒行为 — AIFlow_ML · 2026-08-10