• 周五. 7 月 24th, 2026

中国股市日报主站

中国股民自由频道

PCIe Switch如何成为AI时代关键硬件

4 人参与

当你拆开一台最新AI服务器的内部图,目光往往会先被那几块巨大的GPU散热模块吸引。但在它们脚下,一排不起眼的芯片正默默决定着整机的数据吞吐天花板——那就是PCIe Switch。过去它只出现在高端存储或网络设备里,如今却成了AI算力集群中无法绕过的“慢通胀”瓶颈。

为什么AI训练离不开PCIe Switch?

单看推理任务,一张GPU能独立处理请求;但训练大模型时,动辄上百张GPU需要频繁交换中间激活值和梯度。传统的CPU直连带宽有限,且随着GPU数量增加,全互联拓扑需要极高的PCIe Lane数。PCIe Switch的作用像是铁路枢纽:它把来自不同GPU、NVMe SSD和网卡的数据包按地址重新分发,让多张GPU能同时访问共享存储或跨节点通信。英伟达DGX系列里就内嵌了多颗PCIe Switch,否则根本无法支撑H100之间的NVLink与PCIe混合通信。

从4.0到7.0:速度翻倍背后是散热和信号完整性的妥协

PCIe标准每代带宽翻倍:Gen4单通道约2GB/s,Gen5达到4GB/s,Gen6预计8GB/s。速度越快,信号在PCB走线上的衰减越严重,这时就需要Retimer芯片(信号中继器)来重新整形时钟和数据。澜起科技等厂商正是看准了这个“过渡带”——PCIe Switch和Retimer是成对出现的。一台8路GPU服务器可能需要4-6颗Retimer搭配2颗Switch,而这类芯片的单价从几十美元到上百美元不等,且随速率升级价值量继续上升。

国产替代的窗口期

目前全球PCIe Switch市场由博通和美商祥硕主导,但国内只有澜起科技同时布局了Retimer和Switch两条线。从客户验证周期看,PCIe 5.0 Switch已开始批量出货,6.0版本还在认证阶段。中信证券测算全球市场2028年或达300亿元,其中国产配套空间约70亿——这个数字不算夸张,但考虑到AI资本开支连续两年翻倍,配套硬件的供给弹性往往小于算力芯片本身,也就形成了所谓“慢通胀”逻辑:价格不一定会暴涨,但需求不会消失。

隐藏的风险与博弈

如果只看图表,PCIe Switch确实是一个高确定性的增量赛道。但必须注意两点:一是技术升级节奏过快,PCIe 7.0标准尚未冻结,提前投入的研发费用可能短期看不到回报;二是下游客户集中度过高,一旦云厂商自研互联协议(如英伟达的NVLink、谷歌的TPU互联),通用PCIe Switch的需求就会被压缩。目前数据中心内部的互联架构正从“PCIe为主”转向“PCIe+专用内联”混合模式,Switch厂商需要证明自己还能在异构计算场景里存活下来。

距离AI硬件的下一次基础设施更新还有两年左右窗口期,PCIe Switch能否从“配角”升级为“关键节点”,取决于它是否能承载比带宽更重要的东西——比如低延迟扇出和资源虚拟化。这或许才是真正值得跟踪的变量。

参与讨论

4 条评论
  • 诺克萨斯之手

    H100那堆线看着都头大,Switch要是跟不上,算力再强也白搭 🤯

  • 暗鸦之主

    之前搞过GPU服务器,Retimer和Switch确实是成对出现的,这俩芯片现在挺难拿货。

  • 社牛小野兽

    澜起这波能起来?感觉博通和美商祥硕手里攥着专利,国产替代没那么简单吧…

  • 熊猫眼熬夜

    要是云厂商都搞自研互联,通用Switch厂商岂不是要凉?细思极恐 😰