NextClaw × DeepSeek:三任务实测降本 62%,本次缓存条件下比官方 DSH 低 10.8%

1 小时 26 分钟前
 Peiiii
最近给我在做的开源 AI 助手 NextClaw 做了五步成本优化,也拿官方 DeepSeek Harness ( DSH )跑了一遍对照。同模型、同三项任务,NextClaw 费用比优化前降低 62%,在本次缓存条件下比 DSH 低 10.8%。

模型是 deepseek-v4-flash 。任务包括五文件核对与追问、配置故障诊断与追问、Python 运费边界修复与外部测试。各版本都通过了三项任务。按供应商返回的用量和实验时价格估算,三任务费用合计:

NextClaw 原版:$0.022664
NextClaw 优化版:$0.008613
官方 DSH:$0.009656

缓存命中率分别为 61.99%、84.08%、78.92%。

对照里有个需要说明的差异:NextClaw 首轮多命中了一些缓存,DSH 首轮没有命中。如果只把首轮统一按未命中价格重算,NextClaw 会比 DSH 高约 4.4%。这只是敏感性分析,不是清空缓存后的复测; 10.8% 是当次观测结果,还不能说稳定比官方便宜。

这轮收益比较大的地方是保留原始模型轮次、固定工具声明,以及把部分工具参数改成按需查询。

保留模型轮次那一步,总 token 增加了 5.6%,费用却下降了 33.6%,因为更多输入命中了缓存。只精简常驻提示那一步,费用几乎没动。压缩修复虽然也在五步里,但这组三任务没触发压缩,不能把费用变化算成它的收益。

这是开发版实验,每阶段每项任务只测了一次,没有清空供应商缓存,也没有额外预热。全部 21 个任务样本通过;长会话、大量参数查询的任务还需要另外测试。

五个阶段的费用、token 、耗时,以及完整测试条件和复现方法都整理在这里:
https://docs.nextclaw.io/zh/blog/2026-09-08-deepseek-cache-benchmark

NextClaw 是开源的个人 AI 助手,可以接入模型、调用工具处理任务。想看实现或试用项目:
https://github.com/Peiiii/nextclaw
https://nextclaw.io/zh/download/
90 次点击
所在节点    分享创造
0 条回复

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1240790

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX