• 请不要在回答技术问题时复制粘贴 AI 生成的内容
yohjisakamoto
V2EX  ›  程序员

多步骤 MCP 的 token 损耗,可能主要来自每一步的模型重入

  •  
  •   yohjisakamoto · 1h 3m ago · 50 views

    很多 MCP 演示只有一次工具调用;真实任务更像:创建项目 → 读取项目 ID → 导入素材 → 把 clip ID 交给下一步 → 导出 → 交付。

    普通 agent 每完成一步,都要把结果带回模型,再让模型把 ID 填进下一次调用。Tura 的 command_run Macro 想解决的是这段“交接”:一次描述依赖图,前一步成功产生的变量给后一步在运行时解析;没有依赖的命令可以一起执行。

    公开的电商广告工作流里,两边都通过同样 5 项检查、交付相同结果。Tura Direct 用 3 次模型请求,对照为 11 次;总 token 是 56,372 对 262,915 (少 78.6%)。有意思的是 MCP 调用不是更少,而是 11 对 9:省下的是把累计上下文反复送回模型的成本,不是少干活。

    依赖链更长时,Macro 内每保留一次交接,就少一次模型重入,所以这部分节省会累积;但不是所有任务都严格线性,缓存、重试和任务结构都会影响结果。

    完整 trace 、基准边界和变量继承规则: https://turaai.net/blog#what-we-learned-from-the-mcp-workflow-benchmark

    源码: https://github.com/Tura-AI/tura

    说明:本文分享 Tura-AI 的工作,欢迎讨论这个思路在你们的 MCP 工作流里是否有效。之前看 deep swe 说 https://github.com/swe-agent/mini-swe-agent 比 codex 和 claude code 在 debug 中的 token 消耗和成功率都要好,我今天自己跑了一下,用 gpt5.6 sol 开 high 基本 token 开销比 codex 少 50%,成功率也高 15%左右。下面是我跑的测试数据: https://turaai.net/benchmark 本来是想给我的宏命令做消融试验,但是单独只是改执行,不改提示词,token 消耗其实只减少了 16%左右,成功率提高 11%左右。

    下面是 deepswe 官方的解释: https://deepswe.datacurve.ai/blog/deepswe

    简而言之如果光 debug mini swe agent 好像明显好过模型厂商的官方 agent harness 。

    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   895 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 20ms · UTC 20:27 · PVG 04:27 · LAX 13:27 · JFK 16:27
    ♥ Do have faith in what you're doing.