Terminal Bench 3 发布:未被模型污染的新基准
Distinct_Fox_6358 · reddit · 2026-08-13
全新的基准测试 Terminal Bench 3 正式发布。作者表示,为了保证评测的公平性,该测试集目前尚未被各大模型的训练数据所收录。为防止第三方测试框架引入偏差,作者暂未公布基于第三方 harness 的跑分结果。
「研究」频道最新
- AI实验室研究员预警自动化研究,多个里程碑已提前实现 — The Decoder · 2026-08-13
- Paper2Agent爆火:一键把论文变成可交互AI智能体 — tom_doerr · 2026-08-13
- 选择性不完美:对称破缺作为递归生成机制,跨生物、材料与音乐 — ProfBuehlerMIT · 2026-08-13
- Hugging Face 上新趋势:智能体记忆能力评测排行榜 — agent-memory-leaderboard · 2026-08-13
- 浙大开源 Mechanist:探索大模型机制与安全的智能体 — zjunlp · 2026-08-13
- 开发者设计新基准测试,寻求志愿者协助运行 — -MaskNinja- · 2026-08-13