coefu
9 月 7 日
muse glimmer 30B Q8 kvcache Q8 ,最新的 llama.cpp 支持 context shift, flash attention 。
极致的内存效率:
通过 -ctk q8_0 -ctv q8_0 ,整整 524K ( 2 个 Slot 各 262K )的 KV Cache 居然只占用了 3.78 GB 显存( 3,536 MiB + 248 MiB )!如果换成 FP16 ,光是 KV Cache 就会暴涨到 15 GB+。
长上下文 Prefill 极速提升:
-fa 1 成功开启后,处理几万到几十万 Token 的超长 Prompt 时,Prefill (首包延迟)速度和内存带宽压力会得到数倍的改善。
Context Shift:llama-server 会自动剔除最早的旧对话 Token ,并将 KV Cache 中的数据整体向前平移,保留初始的 System Prompt (系统提示词)和最新的上下文,无需重新计算全量 KV Cache 。
设置 --keep -1:这意味着服务器会自动识别并完整保留初始化输入的 System Prompt ,只对后面的 User/Assistant 历史对话进行平移和丢弃。
比较癫狂。😂