感觉又慢又贵:实测 Kimi-K3 编码能力

7 月 21 日
 greentim

在 Trae 、Qoder 下,分别用 Deepseek-v4 和 Kimi-K3 跑编程任务。Kimi-K3 挺让人失望的

AI Coding 测评准备

测试项目:桌面端知识库工具

用户导入本地文档,系统建立分块索引,支持自然语言提问并返回带引用来源的回答

初始脚手架
运行时:Electron 33 (主进程 Node.js+Chromium )
前端:React 18 + TypeScript ( Vite 构建)
后端:TypeScript 服务层

大家如果想要自己完整测评一下,可以评论区留言,把原项目开源出来

Vibe Coding 工具和大模型

编程工具分别用 字节 Trae 、阿里 Qoder 大模型选择 deepseek-v4-prokimi-3

https://platform.deepseek.com/
platform.kimi.com

知识库工具项目代码,项目名叫starter 用 Harness 加持原starter项目下,新项目叫solution_log 为什么要用到 Harness 的原理,可以阅读下我的文章 https://mp.weixin.qq.com/s/-9Jfwv2SqswbvwZJx5D5bQ

开始测评

知识库Harness + 知识库 两个项目通过 Vibe Coding 完成同样功能开发,相同的需求提示词是这样的

# 任务:构建知识库问答工具
## 产品描述
开发一个桌面端个人知识库问答工具。用户可以导入本地文档,系统对文档建立索引,然后用户可以用自然语言提问,系统从文档中检索相关内容并给出有依据的回答。

## 核心功能需求
### 1. 文档导入
- 用户点击"导入文档"按钮,选择本地 `.txt` 或 `.md` 文件
- 导入后文档显示在左侧文档列表中,包含文件名、大小、导入状态
- 文件大小限制 10MB

### 2. 文档索引
- 导入后,用户点击"建立索引"将文档分块存储
- 索引按段落切分,每块约 500 字
- 索引完成后文档状态变为"已索引",显示分块数量

### 3. 问答功能
- 底部输入框输入问题,点击"提问"按钮
- 系统用关键词匹配方式在已索引分块中检索相关内容
- 返回回答文本 + 引用来源(文档名、分块位置、摘录内容)
- 显示置信度(有引用:0.8 ,无引用:0.2 )
- 每次问答自动保存到历史记录

### 4. 历史记录
- 点击"历史记录"按钮查看所有历史问答
- 以对话气泡形式展示(用户问题在右,系统回答在左)
- 显示时间戳和置信度

## 验收标准

1. 可以导入 `.txt` 或 `.md` 文件,文档出现在列表中
2. 点击"建立索引"后文档状态变为"已索引"
3. 提问后能返回含引用的回答
4. 历史记录中能看到所有问答
5. 重启应用后数据依然存在

在原来的客户端上,一口气开发 "文档导入"、"文档索引"、"问答功能"、"历史记录"四个新功能,并希望 AI 自动化测试验收

测评的结果

项目 Coding 环境 费用时间 成功
知识库 Qoder + Deepseek-V4 4 分钟 1RMB
知识库 Qoder + Kimi-K3 15 分钟 8RMB
知识库 Trae + Deepseek-V4 5 分钟 1RMB
知识库 Trae + Kimi-K3 15 分钟 9RMB
知识库+harness Trae + Deepseek-V4 2 分钟 0.5RMB
知识库+harness Trae + Kimi-K3 18 分钟 8RMB
知识库+harness Qoder + Deepseek-V4 2 分钟 0.6RMB
知识库+harness Qoder + Kimi-K3 12 分钟 9RMB

Kimi-K3 总结

完整案例实操视频和完整原文 https://mp.weixin.qq.com/s/k92i1_ORy5mDE1bOdRG-kw

5073 次点击
所在节点    程序员
13 条回复
ajaxfunction
7 月 21 日
不用向量吗? 效果咋样,我做过的凡是不用向量,命中率非常差
greentim
7 月 21 日
@ajaxfunction 具体举个例子呢,谢谢
wengjin456123
7 月 21 日
我在 kimi code 里用的 k3 ,199 套餐,体验很慢,效果略差于 zcode+glm5.2 ,而且很贵.....
Brrrr
7 月 21 日
真的超级超级超级慢
greentim
7 月 21 日
@wengjin456123 哈哈,看来大家都一样啊,不是我的错觉
greentim
7 月 21 日
@Brrrr 慢就算了,还忒贵,比较坑
iOCZS
7 月 21 日
看来 harness 能提高成功率,但是还是取决于模型能力,跟 ide 关系不大
greentim
7 月 22 日
@iOCZS 影响还蛮大的
afeiya
7 月 22 日
K3 慢的要死 而且额度特别少 为什么慢 我觉得是为了让你觉得额度用的时间长
xixka
7 月 22 日
K3 确实很慢。一些任务还感觉不到优势
david082321
7 月 23 日
我感觉挺好的啊,我把它打起来了,去用一下就知道了,https://kimi3.org/?utm_source=v2ex&utm_medium=reply&utm_campaign=kimi3_org&utm_content=create_topic_reply
david082321
7 月 23 日
官方的 k3 很慢,自己 搭建一个就快了,欢迎使用我搭的
https://k3nova.com/?utm_source=v2ex&utm_medium=reply&utm_campaign=k3nova&utm_content=t1228913_reply
rpish
7 月 23 日
奇怪,那这是怎么拿下 arena.ai webdev sota 的?
2.8T 参数量目前公开最大,贵其实情有可原,毕竟价格依旧是 fable5 1/3 ,但是效果不如 deepseek v4 属实没想到。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1228913

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX