给 Agent 选 benchmark 时,我经常要在论文、仓库和数据集页面之间来回切换:它测的是什么能力?任务怎么来的? Agent 能看到哪些信息、调用什么工具?最后到底按什么判成功?
我做了一个 LLM Benchmark Costco,目前整理了 610 个 LLM / Agent 评测基准,希望让这一步更方便:
- 按能力类别、年份、开放程度等条件筛选候选。
- 查看中英介绍、论文与官方项目入口。
- 用流程图分别看数据构建和运行评测,并展开分支、循环和阶段说明。
可以先从 AutomationBench 这个例子试试,打开“构建流程 / Build Process”,看看跨应用任务、工具调用和终态评分是怎样连起来的。整理后的说明也区分了公开任务、本地成绩和官方私有榜单的范围。
网页无需注册。它用于检索基准和理解协议;真正复现时,仍应回到对应版本的原论文、数据和官方实现。内容会有遗漏或理解偏差,欢迎指出具体条目和来源位置。
想邀请正在做 LLM / Agent 评测的同学,拿一个手头的真实需求试一下:你能否据此找到一个值得进一步复现的基准?最缺哪一项信息?
如果方便反馈,告诉我“评测任务 + 看了哪个条目 + 卡在哪一步”就很有帮助。