返回 AI 学习社区
观点讨论

闲鱼588万元B200服务器:八卡1440GB显存,扫雷都不好意思打开

zZz5 分钟阅读1 次阅读

闲鱼上出现一条标价588万元的B200服务器挂单,卖家称现货64台。附图配置显示,多套方案都围绕HGX B200八卡平台展开,单机GPU显存合计可达1440GB,系统内存最高超过3000GB。这样的机器面向的是大模型训练、微调和高并发推理,真正门槛不只在价格,还在NVLink、NVSwitch、高速网卡、供电、散热和机房基础设施。

002
002

闲鱼588万元B200服务器:八卡1440GB显存,扫雷都不好意思打开

闲鱼上出现一条B200服务器挂单,页面标价588万元,卖家还写着“现货64台,价格便宜”。价格先让人停了一下,附图里的配置更有意思:八颗GPU、上千GB显存,系统内存更是几千GB。

三张配置单,八卡是共同点**

B200是英伟达Blackwell架构的数据中心GPU型号。服务器还要看厂商怎样搭配CPU、内存、硬盘和网络。我把三张商品附图对了一遍,它们展示了不同配置。

两张超微清单都写着SYS-A22GA-NBRT,10U机身,双路6960P处理器,HGX B200八卡平台,单卡180GB HBM3e显存。按清单相加,一台就是1440GB显存,CPU合计144个核心。

区别落在配套上。一张列出24条96GB内存,总计2304GB,另配四块美光7450 PRO数据盘;另一张改成24条128GB内存,总计3072GB,数据盘增至八块,还列了一张BlueField-3 DPU,用于网络等基础设施任务。

第三张标为技嘉G893-AD1-B200,写着8U、两颗8558处理器、HGX B200八卡,以及32条64GB DDR5内存,总计2048GB。它的CPU、内存和机箱方案都不同。

这些是卖家展示的配置内容,尚不能对应到64台库存中的每一台。这里几千GB的DDR5属于系统内存,要与GPU上的1440GB显存分开看。

显存上了千GB,还得让八颗GPU聊得快**

这类机器主要承担模型训练、微调和大规模推理。对它而言,装得下多大的模型、同时服务多少请求,都与显存直接相关。

按英伟达公布的SXM规格,三代产品可以这样比较。

003
003

容量决定能放多少数据,带宽影响GPU读取这些数据的速度。B200还增加了FP4低精度计算支持,适配相应量化方案后,可以提高推理吞吐;实际收益要看模型、精度要求和软件实现,不能拿一个峰值倍数包办所有任务。

举个容量上的例子,一个700亿参数的稠密模型,若每个参数用两字节保存,仅权重就约140GB。运行时还要给对话缓存和中间数据留空间,长上下文、多人并发会继续增加占用;训练还需要梯度、优化器状态等额外空间。八卡大显存的价值,就在这些需求不断叠加时显出来。

如果只是个人跑一个量化后能装进单卡的小模型,普通AI工作站往往就能完成任务。B200的矩阵计算能力也不能直接换算成办公响应或游戏帧数,买这类设备的人关心的是单位时间能完成多少AI计算。

但把模型分到八颗GPU后,它们需要频繁交换数据。HGX B200通过第五代NVLink和NVSwitch连接各颗GPU,前者提供高速链路,后者负责交换转发,单颗GPU的NVLink双向总带宽最高1.8TB/s。这是它与普通多显卡主机很关键的差别。

1440GB是八颗GPU显存相加的容量,软件仍要安排模型怎样分布、数据怎样交换,不能把它当成一张1440GB显卡直接用。

机器有现货,机房也得跟上

超微两张清单里还有一个很能说明用途的细节,各列了八张ConnectX-7网卡,标注NDR 400G。单机内部靠NVLink,跨服务器协作还要靠高速网络,网卡在这里也是核心配件。

假设64台都按八卡配置交付,就是512颗GPU。要让它们共同训练一个模型,还得配交换机、线缆和存储,并让软件分配任务、同步数据。跨机器通信需要时间,存储也可能拖慢进度,不能把单机性能乘以64就当成交付成绩。

供电和散热同样有分量。超微完整清单列了六个5250W电源,采用3+3冗余。这个数字表示电源配置,不能把六个额定功率相加就认定为整机实际耗电。作为同类八卡设备的量级参照,英伟达DGX B200官方标注整机最大功率约14.3kW,并非这条挂单机器的实测值。

10U机身要占机柜空间,配电要按整机要求安排,冷却系统还得持续把热量带走。这台电脑的装机清单,得从机房开始写。

讨论与补充

0

还没有讨论

分享一条可复现的补充、问题或使用经验。

登录后参与回复一起补充步骤、结果和注意事项。