为修评测而生的 Terminal-Bench Pro:8 领域 400 任务零污染
thisguyknowsai · x · 2026-10-06
ROME 团队为解决 agent 评测污染问题推出 Terminal-Bench Pro:
- 8 个领域共 400 个任务
- 零数据污染风险
- 确定性环境、覆盖全面的测试
作者称现有其他 benchmark 基本已被污染或不可靠,这是严格 agent 评测应有的样子。
所属事件:中国团队开源 ROME+ALE 智能体生态,30B 稀疏模型对标 480B(9 条相关)→
「编程与Agent」频道最新
- t3 code 用多 agent 审 PR:本地即时反馈,CI 约 20 秒部署 — samgoodwin89 · 2026-10-06
- Hugging Face Hub 上线 RL 环境筛选器,支持四大框架 — lmoroney · 2026-10-06
- 前特斯拉AI总监跳槽Anthropic,编码Agent差距被点名 — Kuprel · 2026-10-06
- 「五年内 docx 被 Markdown 取代」引发争论:排版与普通用户怎么办 — bytebot · 2026-10-06
- 一个标签页刷新 Bug 让服务器 CPU 打满四天,根因是请求量随标签页数平方增长 — Ok_Negotiation_2587 · 2026-10-06
- loop-engineering:8 种无人值守 Agent 循环模式,让 AI 整夜跑你的仓库 — JafarNajafov · 2026-10-06