我做了一个可以看 skill, agent,和插件是否真的能提高成功率和减少 token 的测试架构

2 天前
 yohjisakamoto

哈喽,这个月早些时候,我发布了 Tura ,并写了几篇博客,探讨了长周期基准评估对 Agent 测试框架的重要性。 https://turaai.net/blog#token-saving-plugins-are-mostly-stupid-idea

在过去的两周里,我看到越来越多的科技 KOL 陆续发布了他们对现有 Token 节省插件(比如 RTK 和 Ponytails )的测试结果: https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-savings/

https://github.com/Tura-AI/benchmark/tree/main 这个 tura-benchmark 框架是和 Tura Agent 一起发布的,但我一直没机会好好介绍它的工作原理。实际上,这个框架可以统一调度基准测试的运行流程,并以相同的结果 schema 导出日志和测试产物。之后,tura-benchmark 网站会通过 CI 自动索引 results 文件夹中发布的所有结果,绘制成图表,并将所有数据直观地展示在前端。

欢迎大家提供一些想测的插件和测试用例,我会在框架中跟进支持;任何人也都可以直接在本地环境中复现这些基准评估,并通过提交 PR 把结果推送到 GitHub 仓库,CI 流程会自动完成结果的索引。

大家可以直接回复这篇帖子,或者在 benchmark 仓库里提交 Issue 。

767 次点击
所在节点    程序员
1 条回复
xy2401
1 天前
没有实际的测试报告吗 我真的好奇 不同 skill/没有 skill 在不同模型下的差异

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1230562

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX