国内 GLM5.2 用 H200 机器可以部署标准版本吗?

7 月 16 日
 EastHorse

领导告我说,使用 H200 ,每个模组 4 块 gpu 卡,2 个模组的话就是 8 块卡,模组与模组之间用 pcie 连接,没思路啊 为啥不用 NVLink 直接连 8 块卡啊? 求指教

2545 次点击
所在节点    Local LLM
8 条回复
demonvinc
7 月 16 日
PCIE 卡呗,现在 HGX 模组进不来。FP8 应该是可以的
namgking
7 月 16 日
H200 应该部署不了完整体,显存不足,完整的起码需要 2 个 8 卡节点
raycool
7 月 16 日
满血版需要两台机器 16 卡吧。
zlo309618100727
7 月 16 日
我也好奇,都 8 卡了,为啥不 nvlink?
arfa
7 月 16 日
8 卡为什么不 VNLINK,因为你买的是单张卡,只能走 PCIE 通道

走 NVLINK,需要 HGX 模组,8 张卡,直接在 1 张主板上集成
podel
7 月 16 日
一张卡 141GB 显存。8 张 1128GB 显存。
一张卡内存带宽 4T 多。跑模型完全够了。

8 个卡直接连接 pcie 总线就行了。其他不管了。
采用流水线并行模式。 可以加载 GLM5.2 8Bit 量化的模型。原版 98%的智能水平,完全够用。
整个应该 20+并发没问题。
purerain
7 月 16 日
FP8 应该没问题
XenoGear
7 月 17 日
fp8+nvlink 可以 8 卡拉起来,要舒服点上下文最好是 16 卡

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1227751

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX