有人用 mbp M5 PRO48GB 跑个本地模型+云端模型(混合)写代码吗?

3 月 13 日
 liujing906qd

比如通过路由分发,简单任务给本地 Qwen 30B MoE ,复杂问题给云端 opus4.6/gpt5.3.等,这种场景实际效果如何呢?

听说 M5 PRO 这次本地跑大模型没有之前那么慢,如果是真的,这种混合架构靠谱吗,还是纯想多了?

3295 次点击
所在节点    MacBook Pro
15 条回复
niubilewodev
3 月 14 日
想多了。
本地跑太慢了。
vcmt
3 月 14 日
这样给你说吧,我朋友买了一台十几万的机器跑,结果还是觉得慢。
YUX
3 月 14 日
完全可以 我用的就是 https://ohmyopenagent.com/ Sisyphus 用 anthropic/claude-opus-4-6 max ,Oracle 用 openai/gpt-5.4 xhigh, Hephaestus kimi-for-coding/k2p5, 其余默认用本地的 qwen3.5 35b
beginor
3 月 14 日
本地跑 zeta 做代码提示感觉还行,其它交给云端大模型
oncethink
3 月 14 日
说起来大家可能不信,这个时间点 mac 上 oMLX 配合 qwen3.5:35b-a3b 这样的 MoE 模型真的很丝滑,前提是得预留 20GB 的内存。
nutting
3 月 14 日
感觉不是慢的问题,尤其是符合那个什么 ai 接口规范的模型,本地好像都有问题,一旦要做些文件之类的操作就有 bug ,如果只是问答可以
YUX
3 月 14 日
@YUX 不过我这样大部分工作还是 Sisyphus 和 Oracle 做的。
liujing906qd
3 月 14 日
@YUX 请问你用的大概是什么样的本地环境呢?我在纠结于 MBP M5 PRO 24/48/64G ,大模型未来两年的发展可能维持住当前的模型大小的基础上提升能力,如果是这样,我可能会考虑 64GB ,但是确实有点贵了。24GB 据说跑 30B MOE 的模型还是很容易爆内存闪退。
liujing906qd
3 月 14 日
@oncethink 是的。我最近通过 notebooklm 去聚合了一下外网的一些视频和文章,可能这真的是能兼容本地速度和云端精度的方案
dilidilid
3 月 14 日
我一直搞不懂你们为啥老幻想在移动设备上跑生产级的 LLM 呢,这么小的模型 token 都是白菜价
YUX
3 月 14 日
@liujing906qd 建议你买个 air 然后硬等 m5 mini/studio
loveumozart
3 月 14 日
我怀疑 lz 是想给自己换新 mac 找一个理由 hhh
leozeeho
3 月 14 日
跑本地模型写代码简直是自寻烦恼,那点内存跑容器都不是太够,还能跑 llm 。。。
gigishy
3 月 16 日
写代码,千问 30bmoe 的质量差了点,这个是关键。
硬件反而不是大问题。
wobuhuicode
3 月 16 日
本地的小模型我一般都用来做 cli 的。这样的好处是我不用记各种命令行。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1198167

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX