面对越来越贵的 token 我们能做什么

1 小时 43 分钟前
 zhangli2946

今早 kimi 申请退款了。

换了 scnet.cn 的按量调用。

我体验下来,模块级别代码补全、vibe coding 、人类强_监督的编程工作中,Deepseek-V4-Flash 已经很够用了。

突然"涌现"了一个想法,缓存命中是复用,"标准构建块" 复用怎么就不是复用了?

贵价模型,输出_消尓壳_代码,不是"殄暴尤物"了。

650 次点击
所在节点    程序员
9 条回复
jhytxy
1 小时 42 分钟前
gemma4 qat 版本已经够用了

两张 2080ti 22g 的事
zhangli2946
1 小时 40 分钟前
@jhytxy 我 4060ti G(8) ~有用~
coefu
1 小时 39 分钟前
如果厂商为了性能更好,都搞隐式推理,显式的 token 生成就会大大降低量。不过订阅就要从纯 token 模式,换花样了,毕竟在他们模型里多跑几趟,那也是耗算力更多。

只要还用厂商 api ,那么就是砧板上鱼肉。
foryou2023
1 小时 33 分钟前
看了一下这个这么贵
foryou2023
1 小时 32 分钟前
@foryou2023 这比官方也贵太多了吧。

DeepSeek-V4-Flash-0731
[暂不支持闲忙时定价] [RPM 预设为 200] 2026 年 7 月 31 日发布的高效轻量化 MoE 模型,总参 284B ,激活 13B ,原生支持百万超长上下文能力。推理速度快、延迟低、调用成本低廉,综合能力均衡,主打高并发、轻量化任务,适合日常对话、内容创作、基础 RAG 、批量文案处理等普惠刚需场景。

模型价格
计费项 单价
输入 3 元 /百万 tokens
缓存命中输入 0.3 元 /百万 tokens
输出 9 元 /百万 tokens
YanSeven
1 小时 29 分钟前
跟随市场而动即可,无所谓,大不了不用。
zhangli2946
1 小时 25 分钟前
@foryou2023 啊? 更贵了?
zimue
1 小时 19 分钟前
我开发一个,可以直接免费使用各平台 AI 的插件,而且解决的就是 TOKEN 太贵的问题,欢迎试试了。这是插件下载地址: https://github.com/07/dda/blob/main/duoda-ai-chrome.zip 。刚更新了官方:www.duodaai.com
msg7086
58 分钟前
按量用不起,我还是订阅吧。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1240082

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX