创意基准测试展示:如何用怪诞想法评估模型
mariofilhoml · x · 2026-08-26
展示了一份关于基准测试的演示文稿,重点介绍了各种奇特、富有创意的测试想法。
「研究」频道最新
- TIDES 数据集发布:12 团队全学期双语协作记录 — josephseering · 2026-08-27
- 京都大学 MemUse 研究:对话记忆自然集成比问答评测更准 — Kyoto-University · 2026-08-27
- GPT-5.6 自研新内核,TPU 优化提速近 10 倍 — HuaxiuYaoML · 2026-08-27
- RSI-Exam 基准发布:测 AI 递归自我改进能力 — HuaxiuYaoML · 2026-08-27
- Gordian 机器筛靶点 1327 个,药物发现加速数年 — juanbenet · 2026-08-27
- 多智能体训练的奖励机制与收敛性讨论 — jessi_cata · 2026-08-27