macbook 32G 内存, M5 芯片本地跑大模型有推荐的吗?

3 月 31 日
 Hermitist
我用了 qwen3.5-27B 能跑但是比较慢, 换成 9B 的比较快但不太聪明.

我本地用的推理框架是 omxl, 然后用小龙虾对接, 干活是能干活,就是有点慢, 当然和 codex 不能比, 可惜 codex/claude code 这些 key 烧的太快, 要等 7 天后, 这也是我本地跑大模型追去无限 token 的初衷.

请问各位能给予我的配置推荐几个更好更聪明的大模型吗?

另外基于刚出的谷歌 atomic chat, 这几天有人逆向优化了它, 号称在普通的 macbook 上也可流畅加载 35B 大模型,KV 缓存直接压缩 4.6 倍,不到一周就有 1.5K stars 了.

这是 github 仓库地址 https://github.com/TheTom/turboquant_plus

不过它是加载进 llama.cpp 部署, 这个切换模型需要手动, 我懒得折腾了, V 站有闲的人去折腾下, 然后告诉我实际效果吧, 可以的话我准备照抄作业.


另外附加上当前 qwen3.5-9b 的 tokens 用量, 真的很快, 随便让小龙虾干点活就上千万 token.

5584 次点击
所在节点    Local LLM
26 条回复
Jtyczc
4 月 1 日
用 Claude Code 做任务编排,具体执行可以用本地大模型执行。

本地大模型永远比不上最一线 T0 的云端大模型。
jiche
4 月 1 日
@Hermitist 我也是 M5 32G Air ,动不动就 100 度,然后降频,不行啊。
ysn2233
4 月 1 日
没有,即使是 m5max 128G 也没必要,纯浪费时间,老老实实用 API ,除非要搞 NSFW 的东西。
SayHelloHi
4 月 1 日
https://github.com/AlexsJones/llmfit

这个工具 可以查询一下适合自己电脑配置的模型
Liu6
4 月 10 日
现在都 M5 了吗? 我的 M1 已经这么老了吗
leon0318
5 月 25 日
@jiche #22 一般都是用 M5 air 什么工作啊?降频这么严重 (另外,M5 出吗?

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1202513

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX