开发者设计新基准测试,寻求志愿者协助运行
-MaskNinja- · reddit · 2026-08-13
一位开发者设计了一种新型基准测试,希望测试不同模型,但成本高昂,因此寻求有补贴成本的志愿者帮忙运行并提供数据。同时欢迎对基准测试改进的建议。
「研究」频道最新
- AI实验室研究员预警自动化研究,多个里程碑已提前实现 — The Decoder · 2026-08-13
- Paper2Agent爆火:一键把论文变成可交互AI智能体 — tom_doerr · 2026-08-13
- 选择性不完美:对称破缺作为递归生成机制,跨生物、材料与音乐 — ProfBuehlerMIT · 2026-08-13
- Hugging Face 上新趋势:智能体记忆能力评测排行榜 — agent-memory-leaderboard · 2026-08-13
- 浙大开源 Mechanist:探索大模型机制与安全的智能体 — zjunlp · 2026-08-13
- Terminal Bench 3 发布:未被模型污染的新基准 — Distinct_Fox_6358 · 2026-08-13