用 antirez 的 llama.cpp fork 把 DeepSeek v4 Flash 在本地跑起来了

4 月 28 日
 Livid

https://github.com/antirez/llama.cpp-deepseek-v4-flash

5924 次点击
所在节点    Local LLM
15 条回复
Livid
4 月 28 日
洗车测试也过了,不过从思考过程来看是它知道这是一道 typical 测试题:

940i3s34v4F1HW41
4 月 28 日
赞
Tink
4 月 28 日
是啥硬件跑的呢
Livid
4 月 28 日
@Tink M4 128G
ares001
4 月 28 日
实际运行起来占用多少显存?
Hermitist
4 月 28 日
sentinelK
4 月 28 日
相较而言,个人体感还是 Qwen3.6 35B A3B 在 localLLM 上跑的更顺一点,benchmark 评分也是和 v4 flash 互有胜负
Tathagatagarbha
4 月 28 日
向大佬学习
unnyxi
4 月 29 日
@sentinelK 如果 Qwen3.6 35B A3B 和 v4 flash 互有胜负,Qwen 3.6 27B 岂不是碾压 v4 flash 了...
elepant
4 月 29 日
跑起来 和 好用,真的是两码事。M4 本地跑 LLM ,响应是真的是慢。。。
sentinelK
4 月 29 日
@unnyxi 如果是默认的思考长度的话,是的,但是 27B 目前还打不过 flash 的 max 思考长度
PeterTanJJ
4 月 29 日
Qwen3.6 35B A3B 速度很快,有试过没?

这个 flah 感觉不如 minimax
xuhengjs
4 月 29 日
期待 qwen3.6-36B-A3B 的终极优化方案
PeterTanJJ
4 月 29 日
@unnyxi 27B 的输出速度不行
jinsongzhaocn
5 月 3 日
@PeterTanJJ 27b 的速度,参数和 post 结构影响很大. 我经历过 11 秒到 1 秒的提速

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1208974

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX