给 Agent 选 benchmark 时,我经常要在论文、仓库和数据集页面之间来回切换:它测的是什么能力?任务怎么来的? Agent 能看到哪些信息、调用什么工具?最后到底按什么判成功?
我做了一个 LLM Benchmark Costco,目前整理了 610 个 LLM / Agent 评测基准,希望让这一步更方便:
可以先从 AutomationBench 这个例子试试,打开“构建流程 / Build Process”,看看跨应用任务、工具调用和终态评分是怎样连起来的。整理后的说明也区分了公开任务、本地成绩和官方私有榜单的范围。
网页无需注册。它用于检索基准和理解协议;真正复现时,仍应回到对应版本的原论文、数据和官方实现。内容会有遗漏或理解偏差,欢迎指出具体条目和来源位置。
想邀请正在做 LLM / Agent 评测的同学,拿一个手头的真实需求试一下:你能否据此找到一个值得进一步复现的基准?最缺哪一项信息?
如果方便反馈,告诉我“评测任务 + 看了哪个条目 + 卡在哪一步”就很有帮助。
这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。
V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。
V2EX is a community of developers, designers and creative people.