编程效果对比 本地 Qwen3.8-27B vs Deepseek

8 小时 22 分钟前
 ashong

提示词

需要一个 svg 动画页面, 内容为一只鹈鹕骑自行车。要求:
- 鹈鹕生动形象
- 关节运动要自然、不生硬

除了 Deepseek 网页版,其他都是用 Deepseek Harness.

Qwen 模型均来自 unsloth

模型 缓存量化(ctk:ctv) 耗时 轮数 平均输出速度 t/s 缓存命中率% 总输入 总输出 预览 费用(元)
Deepseek 网页 - 12 分 32 秒 2 - - - - https://dspage.previewship.net/ 0
Deepseek Flash - 38 分 27 秒 1 123 99 11.9M 266K https://dsflash.previewship.net/ 1.93
Qwen3.8 27B Q5_K_M q8_0:q4_0 5 分 52 秒 1 77 98 95.5K 26.5K https://q5kmq8q4.previewship.net/ 0.02
Qwen3.8 27B Q5_K_M q8_0:q8_0 23 分 20 秒 1 69 98 818K 111K https://q5kmq8q8.previewship.net/ 0.09
Qwen3.8 27B Q4_K_M q8_0:q8_0 16 分 13 秒 1 63 94 631K 67.7K https://q4kmq8q8.previewship.net/ 0.06
Qwe3.8 27B UD_Q4_K_XL q8_0:q8_0 16 分 59 秒 1 58 94 131K 57.8K https://udq4kxlq8q8.previewship.net/ 0.06

电费按 0.5 元/度计算

提示词语义比较模糊, 所以思考时长会多一些

本地环境

硬件:7900xtx

系统:ubuntu 26.04

软件: llama.cpp + vulkan

更喜欢哪一个结果?

1801 次点击
所在节点    程序员
25 条回复
ByteZone
1 小时 54 分钟前
48GB 的 mac mini 跑 QWen 3.6 27B 做 rag 慢的要是
硅基流动一到两分钟 本地 ollama 要 10 到 60 分钟不等
大佬知道问题出在哪里了吗
ashong
1 小时 47 分钟前
@honjow

启动参数供参考:

-t 10
-b 512
-ub 256
--spec-draft-n-max 3
--fit off
--no-context-shift
--metrics
--kv-unified
--jinja
--cache-type-k q8_0
--cache-type-v q8_0
-fa on
--spec-type draft-mtp
--ctx-size 131072
--parallel 1
-ngl -1
--chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"}
--no-mmap
--temp 0.6
--top-p 0.6
--top-k 15
--repeat-penalty 1
--repeat-last-n 64
--override-tensor blk\.\d+\.ffn_.*_exps\.=CPU
--image-min-tokens 1024
--no-warmup -
-cache-ram 16384
--alias qwen3.8-27b-q5km
PopRain
48 分钟前
这个测试太多了,应该换个鸟,譬如鸵鸟再看看效果
pldxx
31 分钟前
收藏一下
C64NRD
19 分钟前
这个理解能力可以胜任很多 web 工作,就是耗时太久了

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1236180

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX