爱意满满的作品展示区。
joe1chief

做了一个 LLM / Agent 评测基准浏览器,把数据构建和评分流程放在一起看

  •  
  •   joe1chief · 1h 19m ago · 69 views

    给 Agent 选 benchmark 时,我经常要在论文、仓库和数据集页面之间来回切换:它测的是什么能力?任务怎么来的? Agent 能看到哪些信息、调用什么工具?最后到底按什么判成功?

    我做了一个 LLM Benchmark Costco,目前整理了 610 个 LLM / Agent 评测基准,希望让这一步更方便:

    • 按能力类别、年份、开放程度等条件筛选候选。
    • 查看中英介绍、论文与官方项目入口。
    • 用流程图分别看数据构建和运行评测,并展开分支、循环和阶段说明。

    可以先从 AutomationBench 这个例子试试,打开“构建流程 / Build Process”,看看跨应用任务、工具调用和终态评分是怎样连起来的。整理后的说明也区分了公开任务、本地成绩和官方私有榜单的范围。

    直接使用 · GitHub 代码与反馈

    网页无需注册。它用于检索基准和理解协议;真正复现时,仍应回到对应版本的原论文、数据和官方实现。内容会有遗漏或理解偏差,欢迎指出具体条目和来源位置。

    想邀请正在做 LLM / Agent 评测的同学,拿一个手头的真实需求试一下:你能否据此找到一个值得进一步复现的基准?最缺哪一项信息?

    如果方便反馈,告诉我“评测任务 + 看了哪个条目 + 卡在哪一步”就很有帮助。

    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3149 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 22ms · UTC 14:01 · PVG 22:01 · LAX 07:01 · JFK 10:01
    ♥ Do have faith in what you're doing.