有一台 16 寸 m1max 64g+1T 满 GPU 的 MacBook Pro 适合部署哪个本地模型

4 月 30 日
 alangz

配置为 m1max 64g+1T ,最近搞了个小小龙虾,消耗的 token 太快了,打算部署各本地模型,一来了解了解,而来是想做下简单的翻译、文档处理的工作。能有合适的本地模型吗?

2692 次点击
所在节点    Local LLM
11 条回复
zenfsharp
4 月 30 日
Gemma4-31b-it-q8_0 ,记得开满 256Context 窗口,也用 Q8 质量压缩。
huaweii
4 月 30 日
qwen3.6 系列,你 64gb 的选择挺多的。你去 hf 上把你的型号输入进去让他给你选个合适的压缩模型就行
xFrye
4 月 30 日
https://ollama.com/blog/mlx 看看这个合适不
sentinelK
4 月 30 日
mlx 的 qwen3.6-35B-A3B 试试看
alangz
4 月 30 日
@zenfsharp 好的,我试试
@huaweii 多谢,我去研究。
@xFrye 我试试看,多谢
@sentinelK 我看下,多谢
rrubick
4 月 30 日
用 LM sutio ,它会根据你的内存大小标记合适的模型。注意由于模型需要常驻内存,不要卡着上限
rrubick
4 月 30 日
@rrubick
typo:LM sutio —> LM Studio
diudiuu
4 月 30 日
ahdw
4 月 30 日
建议看看 oMLX 的社区评测,不要用 llama.cpp ,浪费苹果硬件
alangz
4 月 30 日
@rrubick 好的,感谢
@diudiuu 这个确实更方便些,多谢
@ahdw 我去看看
davidqw
5 月 2 日
gemma4

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1209674

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX