AI 评估沙盒化难度大,研究者自嘲“慢慢疯了”
kevinnbass · x · 2026-08-06
Kevin Bass 在推文中表示,跨框架和模型进行沙盒化评估以确保科学准确性非常困难,并自嘲自己可能正在慢慢发疯。这反映了 AI 评估领域的技术挑战。
「研究」频道最新
- 南大提出 AVE-Compass:专测音视频协同编辑的全新基准 — NJU-LINK · 2026-08-06
- Kimi K3 架构深度解析:2.8T 参数与 LatentMoE 细节揭秘 — AxSaucedo · 2026-08-06
- NBER论文:近两成职场人篡改履历,AI技能提及激增 — steverathje2 · 2026-08-06
- Nature 重磅:绘制人类转录因子 DNA 结合特异性扩展图谱 — anshulkundaje · 2026-08-06
- 《百页语言模型书》发布:用PyTorch从零构建LLM — burkov · 2026-08-06
- 《百页语言模型书》暗黑版发布,手把手教你构建LLM — burkov · 2026-08-06