查看: 3|回复: 1

多步骤 MCP 的 token 损耗,可能主要来自每一步的模型重入

[复制链接]

10

主题

10

回帖

50

积分

注册会员

积分
50
发表于 2026-8-16 03:24:10 | 显示全部楼层 |阅读模式
很多 MCP 演示只有一次工具调用;真实任务更像:创建项目 → 读取项目 ID → 导入素材 → 把 clip ID 交给下一步 → 导出 → 交付。

普通 agent 每完成一步,都要把结果带回模型,再让模型把 ID 填进下一次调用。Tura 的 command_run Macro 想解决的是这段“交接”:一次描述依赖图,前一步成功产生的变量给后一步在运行时解析;没有依赖的命令可以一起执行。

公开的电商广告工作流里,两边都通过同样 5 项检查、交付相同结果。Tura Direct 用 3 次模型请求,对照为 11 次;总 token 是 56,372 对 262,915 (少 78.6%)。有意思的是 MCP 调用不是更少,而是 11 对 9:省下的是把累计上下文反复送回模型的成本,不是少干活。

依赖链更长时,Macro 内每保留一次交接,就少一次模型重入,所以这部分节省会累积;但不是所有任务都严格线性,缓存、重试和任务结构都会影响结果。

完整 trace 、基准边界和变量继承规则:
https://turaai.net/blog#what-we-learned-from-the-mcp-workflow-benchmark

源码:
https://github.com/Tura-AI/tura

说明:本文分享 Tura-AI 的工作,欢迎讨论这个思路在你们的 MCP 工作流里是否有效。之前看 deep swe 说 https://github.com/swe-agent/mini-swe-agent 比 codex 和 claude code 在 debug 中的 token 消耗和成功率都要好,我今天自己跑了一下,用 gpt5.6 sol 开 high 基本 token 开销比 codex 少 50%,成功率也高 15%左右。下面是我跑的测试数据:
https://turaai.net/benchmark
本来是想给我的宏命令做消融试验,但是单独只是改执行,不改提示词,token 消耗其实只减少了 16%左右,成功率提高 11%左右。

下面是 deepswe 官方的解释:
https://deepswe.datacurve.ai/blog/deepswe

简而言之如果光 debug mini swe agent 好像明显好过模型厂商的官方 agent harness 。
回复

使用道具 举报

9

主题

150

回帖

327

积分

中级会员

积分
327
发表于 2026-8-16 10:56:27 | 显示全部楼层
措辞 AI 味太重了。“但是单独只是改执行,不改提示词” 单独什么?这是人看的吗?
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部