@
catazshadow 彻底疯狂了,🤪。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF ,我推荐你用这个。
我的 64G umem 环境里,之前完全跑不动的 Q4 (首字 5min 才出来,0.5 tok/s )。
用了 llama.cpp 的 lazy 模式,首字 20s 不到,初始 20+ tok/s ,到 20w context 的时候还有 7 ~ 8 tok/s ,结果 llama.cpp 直接 context shift 了,同一个 slot 没有出现 context oom ,直接又从 9w 开始轮转,用上了 swap ,swap 蹭蹭涨,但是 tg 还有 10 tok/s 。
只能说 ,太屌了。
我之前 qwen3.8 27B 干的活儿,让 flash 找了好多 bug ,甚至很多深度 bug ,影响整个项目方向的 bug 都找得出来。
GPQA-D & scicode 的 benchmark 含金量是真的高,GPQA-D flash 比 27B 只高 2.5 分左右,能指导后者工作。GPQA-D 的 90 分,是个真正能力分水岭。27B 只有 89.2 ,flash 91.7 ,Fable 5 92.6 。这个 Q3 91.41 。