
Marvell 这波消息说实话我听到第一反应是终于来了。AI 数据中心这两年最热闹的词已经从单纯的 Scale-out 横向扩展切到了 Scale-up 纵向互联而 PCIe 交换机恰恰是这条赛道上最容易被忽视、又最关键的底层设施。Marvell 发布业界首款 260 通道 PCIe 6.0 交换芯片目标直指 AI 数据中心的 Scale-up 基础设施这件事值得所有做大模型训练、GPU 服务器、存储池化的工程师认真看一看。这篇文章我会把几件事讲透Scale-up 和 Scale-out 到底怎么分工PCIe 6.0 这次升级带来的技术变化有多大260 通道意味着多少真实带宽它能用在哪些典型场景里以及我们在实际工程落地时会踩到哪些坑。这个话题适合 AI 基础设施工程师、数据中心架构师、服务器硬件研发和做系统集成的朋友对刚入门想理解下一代服务器内部互联的人同样友好。1. AI 数据中心的 Scale-up到底在扩什么1.1 Scale-up 和 Scale-out两个方向一套逻辑过去十几年互联网行业谈扩展基本都是 Scale-out。业务量上来了往机柜里加服务器用负载均衡把流量分散到更多节点上。这是横向扩展的逻辑靠网络把一堆独立的设备串起来整体能力随节点数量线性增长。Scale-up 的路子是反过来的。它不追求堆节点而是把一个计算单元内部的资源做厚做强。比如一台服务器里挂四块 GPU、八块 GPU、十六块 GPU让 CPU、GPU、内存之间形成一个紧密耦合的计算域。这个方向的驱动力来自 AI 训练负载的特殊性。大模型训练有个很核心的现象每一次迭代所有参与计算的 GPU 都要做梯度同步。假设训练一个千亿参数的模型模型状态和梯度加起来可能有几十 GB每训练一步就要把这些数据在所有 GPU 之间过一遍。这一步的通信效率直接决定训练速度。如果把这些 GPU 分散到多台服务器上通过以太网通信单次同步延时会高到让 GPU 被迫在每步之间空等如果把它们塞进一个高速互连的域里通信延迟和带宽就能压到可以接受的水平。所以 AI 数据中心的两层结构越来越清晰Scale-up 负责在一个超节点内部把计算资源焊在一起Scale-out 负责把这些超节点连接成更大的集群。过去大家讨论 InfiniBand、RoCE 谈得很多那属于 Scale-out 的范畴而 Scale-up 这一层很长一段时间都被 NVIDIA 的 NVLink 生态主导开放生态的玩家一直在找突破口PCIe 交换机就是那个突破口之一。1.2 PCIe 交换机把内部总线变成内部网络很多人对 PCIe 的理解还停留在主板上那些长条插槽上——插显卡、插固态盘。实际上 PCIe 从物理形态上虽然像总线但它的协议本质是一种基于数据包的串行互连。只不过传统的 PCIe 拓扑受限于 CPU 根复合体一个 CPU 有几组根端口直接连几个设备设备的数量很快就被通道数卡死了。PCIe 交换机的角色就是在这中间加一层转发网。它的工作原理类似于交换机在以太网里的作用CPU 不需要亲自持有所有设备的通道设备通过 PCIe 交换机接入交换机根据地址信息在任意两个端口之间转发数据包。这就把 PCIe 从一个CPU 直连外设的限制性拓扑解放成一张真正的内部交换网络。在 AI 服务器场景里这个能力特别关键。一个 CPU 通常只有几十条 PCIe 通道撑死挂上两三个 GPU 加一两块网卡。但一个 AI 计算域可能要同时挂八块 GPU、一大批 NVMe、高带宽网卡、内存扩展设备。如果没有 PCIe 交换机CPU 的通道资源根本不够用。Marvell 这次发布的 260 通道 PCIe 6.0 交换机等于把一个 AI 超节点内部的可连接设备数量放大了好几个数量级。260 条通道如果按 x16 拆分差不多能提供 16 个满速端口这意味着 16 个加速器或存储设备可以同时全速通信。这个级别的交换能力以前在开放生态里是很难想象的。2. 260 通道 PCIe 6.0 的核心参数拆解2.1 PCIe 6.0 的技术亮点全在这里PCIe 6.0 最大的变化是传输速率从 PCIe 5.0 的 32 GT/s 翻倍到了 64 GT/s。这个翻倍不是一个简单的数字游戏背后是信号调制方式的根本性变革。PCIe 5.0 及之前的版本都用 NRZ 信号一个符号传输 1 比特靠电平高低区分 0 和 1。到了 6.0 这个速率如果继续用 NRZ信号频率会高到让 PCB 走线几乎无法承受眼图会完全闭合。所以 PCIe 6.0 换成了 PAM4 调制用四个电平00、01、10、11表示 2 比特。四个电平让单个符号携带的信息翻倍符号速率不需要继续翻倍就能把数据速率从 32 GT/s 推到 64 GT/s。PAM4 不是免费的午餐。四个电平之间的电压差变小了同样的噪声和串扰下更容易出错。所以 PCIe 6.0 引入了轻量级 FEC 前向纠错还加了循环冗余校验机制。FEC 的作用是接收端发现错误后可以本地纠正不需要重传对降低误码率很有帮助付出的代价是增加了几纳秒的延迟和部分带宽开销。编码层面PCIe 6.0 继续沿用 128b/130b 编码这意味着 64 GT/s 原始速率里实际有效数据速率要乘一个 128/130 的效率系数。单条通道的有效速率大约是 63 Gbit/s除以 8 之后单通道单向约 7.88 GB/s。相比 PCIe 5.0 单通道 3.94 GB/s正好翻了一倍。2.2 260 条通道的带宽该怎么算260 条通道是这个产品最有冲击力的数字也是最容易被误读的数字。我第一次看到的时候先算了一笔账单通道有效速率约 7.88 GB/s260 条通道单向总带宽就是 260 × 7.88 GB/s大约 2.05 TB/s。如果算全双工双向就是约 4.1 TB/s。这个带宽量级是什么概念呢一块 PCIe 5.0 x16 的 GPU 双向只有约 126 GB/sPCIe 6.0 x16 的双向带宽能到 252 GB/s。一个 260 通道的交换机理论上可以同时动态组织这些端口让几十个设备在一个域里全速交换数据。260 这个数字还有一个很巧妙的工程意义。常见的 PCIe 端口位宽是 x4、x8、x16260 16 × 16 4。也就是说这颗芯片很自然的就可以拆成 16 个满速 x16 端口再留 4 条通道做管理路径或辅助连接。这种规整的通道分配在芯片封装层面更容易做引脚排布和信号布线也方便系统厂商按标准端口设计主板。需要注意交换机标称的 260 通道是总吞吐能力实际能同时跑多快取决于端口配置和流量模型。比如全部配置成下行端口时所有下行设备共享上行带宽除非上行链路也有足够的根端口承接。更常见的做法是分配一部分端口做上行一部分做下行形成树状或网状拓扑。所以衡量这颗芯片的能力不光是看带宽总和还要看端口灵活性和交换矩阵的满配置吞吐能力。2.3 为什么 Marvell 选择 260 这个档位关于通道数还有一个产业视角的问题市场上不是没有 PCIe 6.0 交换芯片为什么 Marvell 说自己是业界首个 260 通道PCIe 交换芯片实现 260 通道的难度主要在芯片面积、封装引脚和功耗三者之间找平衡。通道越多SerDes 单元就越多芯片面积和功耗同步上涨。260 通道意味着芯片上要集成 260 个高速收发器每个收发器还要跑 PAM4 和 FEC 处理逻辑这对设计团队和工艺选择都是硬挑战。从市场需求看AI Scale-up 场景需要高端口密度的交换芯片。上一代主流 PCIe 5.0 交换机很多停留在 x48 或 x64 通道级别挂四到八个 GPU 就撑死了。但要组建 16 卡、32 卡的 AI 计算域交换芯片必须具备 128 通道以上的能力并且向上要能扩展到 256 以上。260 通道正好卡在16 个 x16 端口这个甜点上对齐了 8 卡和 16 卡的典型 AI 服务器配置。同时也合理推测260 通道的设计考虑到了 CXL 的延伸需求。CXL 3.x 的物理层和 PCIe 6.0 同源未来这颗芯片如果支持 CXL 协议模式260 通道能同时承担加速器互连和内存池化的负载。这从产品生命周期的角度看比单纯只做 PCIe 交换更有价值。3. 这颗交换芯片能做什么三个典型场景3.1 GPU 资源池化让每块卡都不闲着GPU 资源池化是 AI 数据中心降本增效的大趋势也是 PCIe 交换机最直接的应用场景。传统的 GPU 服务器配置是一台物理机对应固定数量的 GPUGPU 通过主板或专用的扩展板直连 CPU。问题在于 GPU 利用率是不均匀的训练任务把 GPU 吃满推理任务可能只用到一半有的业务甚至只是偶然需要 GPU。如果 GPU 是物理绑定的就很难在多个业务之间动态调度。引入 PCIe 交换机后GPU 可以不固定在某个 CPU 上而是挂到交换机上形成一个资源池。多台主机通过各自的上行端口连接交换机按需申请 GPU 资源。任务结束GPU 释放回池子下一个任务可以立即接管。这个思路在推理场景尤其有价值因为推理服务通常有波峰波谷资源池化能显著提高 GPU 的平均利用率。PCIe 6.0 的高带宽让这种方式变得可行。之前用 PCIe 5.0 做池化单 GPU 的带宽瓶颈比较明显现在 PCIe 6.0 x16 能提供 252 GB/s 的双向带宽这对推理和多数训练场景已经足够CPU 和 GPU 之间通信不会成为主要矛盾。3.2 内存扩展和异构加速器解耦AI 场景还有一个被忽视的痛点内存容量和带宽不够。单个 GPU 的显存容量有限当模型规模超过单卡显存时要么模型并行切分要么引入统一内存。PCIe/CXL 交换机正好是解决内存池化的重要手段。CXL 协议允许 CPU 和加速器访问共享内存池PCIe 6.0 的物理层是 CXL 3.x 的基础。260 通道交换机如果支持 CXL over PCIe就能构建一个跨多主机的内存池。比如训练任务需要 1TB 内存但单台机器只有 512GB通过内存池化另一台服务器的内存也能被访问扩展内存不需要改动应用逻辑。这块对高性能计算和大规模图计算尤其有意义。传统方式中数据要从内存搬到另一台机器的存储系统协议开销大、延迟高内存池化让所有计算节点像访问本地内存一样访问共享内存带宽和延迟都大幅改善。3.3 支持开放的超节点式 Scale-up 拓扑Scale-up 超节点的讨论是当前 AI 网络最热的题。一个超节点内包含几十个加速器它们需要在一个低延迟、高带宽的域内紧密协作。NVIDIA 用 NVLink 和 NVSwitch 构建了自己的超节点开放生态这边的思路则更多依赖 PCIe 交换和 UALink 这样的联合标准。Marvell 的 260 通道 PCIe 6.0 交换机等于给了开放生态一个能真正撑起超节点规模的硬件支撑。它可以把多 GPU 直接通过 PCIe 交换互联不需要经过以太网也不依赖封闭的私有协议。这对做国产化 AI 服务器、或者想摆脱单一供应商绑定的团队来说是很有吸引力的方案。具体到部署可以设计成 16 个节点的计算域每台节点占一个 x16 端口上行连到交换机节点之间跨交换通信做梯度同步和数据交换。相比走以太网这个方案延迟低得多相比走私有协议它又是标准产品采购和运维的灵活性都更好。4. 对产业格局和服务器设计的影响4.1 和 NVLink、Broadcom PEX 摆在一起看Marvell 这枚芯片的发布放在产业格局里看很有意思。NVIDIA 的 NVLink 是目前 AI Scale-up 的事实标准带宽确实做得很高但它是封闭的只有 NVIDIA GPU 能接入。AI 数据中心一旦选了 NVLink等于绑定了 NVIDIA 的整机方案。很多大型云厂商都有动力扶持开放生态来打破这种绑定PCIe 交换这类通用标准器件就是最自然的抓手。在 PCIe 交换这个细分领域Broadcom 的 PEX 系列一直是老牌玩家在存储和服务器市场占有率很高。Marvell 这次抢在 PCIe 6.0 时间点上放大端口密度到 260等于向市场喊了一个最强音在 AI Scale-up 这个新战场我不只做存储连接的交换芯片我要做整个 AI 超节点的底座。从时间点看PCIe 5.0 交换芯片在数据中心刚刚铺开Marvell 直接推进到 PCIe 6.0 260 通道这个代差能形成一段产品空窗期。对系统厂商来说如果现在规划下一代 AI 服务器直接基于 Gen6 设计可以避免一年后又升级一轮的痛苦这也是发布节点卡得很准的原因。4.2 这枚世界首发会给系统设计带来什么从服务器设计角度看260 通道 PCIe 6.0 交换机带来的连锁反应比想象中更复杂。第一主板上必须预留大量高速走线空间。260 条通道如果全走 PCB 表层会占掉相当大的板面积而且 64 GT/s 速率下对走线长度和过孔残桩的要求非常苛刻。系统设计基本要采用链路预算法在交换芯片和终端设备之间规划好走线长度超过阈值就必须加 retimer 或 redriver。第二端口速率上去了连接器标准也在升级。PCIe 6.0 对应的连接器需要在更高速率下保持信号完整性普通的 PCIe 5.0 连接器是否能用是个问题。很多高端系统可能会转向专门设计的背板连接器比如加高型连接器。这部分成本会传导到整体服务器造价上。第三散热问题不容忽视。260 通道的交换芯片集成了大量高速 SerDes功耗一定不低。我判断整颗芯片的功耗会在百瓦级别散热量接近一颗中高端 CPU。系统设计需要给它安排独立散热器、合理风道甚至可能影响机箱的尺寸和布局。这不是简单换颗芯片的事整套机械和热设计都要跟着变。5. 我在工程上会重点盯的坑5.1 信号完整性Gen6 不是开玩笑的PCIe 6.0 的 PAM4 信号对链路损耗极其敏感。同样一段 PCB 走线在 PCIe 5.0 上可能没问题换到 6.0 速率眼图就会闭合。工程上的第一原则是设计阶段必须做完整的链路仿真而不是等板子打回来再调。实测中我发现最容易出问题的点有三个PCIe 走线跨层换层时的过孔残桩、连接器附近阻抗不连续、以及多通道并行时的串扰叠加。64 GT/s 下这些问题的劣化效应会被放大严重时会出现链路训练失败或者设备协商到低速模式。规避方法包括选择低损耗板材、缩短走线、使用背钻工艺、预留 retimer 位置。5.2 功耗与散热面积和风道冲突很多团队在新设计里只关注了带宽提升对功耗预估不足。PCIe 6.0 交换芯片的功耗相比 Gen5 会有明显跃升PAM4 的 DFE 和 FEC 逻辑都是耗电大户。如果系统原本按 PCIe 5.0 的功耗预算设计上 Gen6 后可能会过热。我能给的经验是前期规划时把功耗余量放大 20% 到 30%。散热设计要考虑到交换芯片临近大量高速走线不能用太厚的散热器把风道堵死必要时要做导风罩或增加静压风机。更重要的是要实时检测交换芯片的温度并把降频策略做好防止极端工况下芯片掉速影响业务。5.3 向后兼容和生态成熟度别当好高骛远的图纸党PCIe 标准是向后兼容的Gen6 插槽可以跑 Gen5 设备但我们要清醒认识到一个现实目前许多 CPU 和 GPU 的 PCIe 控制器还停留在 Gen5原生 Gen6 的加速器端口还没大规模铺开。这意味着即使买了 260 通道 Gen6 交换芯片短期内连接的可能还是大量 Gen5 设备跑在 Gen5 速率上。这不是说芯片不值得买而是提醒我们在规划系统时要算清楚性能账。如果所有终端设备都是 Gen5交换芯片的 Gen6 能力就吃不满投资回报率存疑。稳妥的策略是分阶段演进先在交换层面支持 Gen6终端设备逐步升级同时保证端口的自适应协商能力做得好这样新老设备能混跑不翻车。另外PCIe 交换机不是装上就能跑固件配置、端口分组、QoS 策略都要花时间调。我建议小规模验证时就把链路训练时间、错误重传次数、FEC 纠错率这些指标监控起来这些数据最能反映整个链路是否健康。5.4 延迟和业务适配高带宽不自动等于高性能最后一个容易被忽视的坑是延迟。PCIe 6.0 引入 FEC 后链路的误码率降低了但 FEC 处理本身会带来额外的延迟开销。虽然这个延迟通常是纳秒级对多数场景无感但在对延迟极其敏感的通信同步场景还是要做实测评估。另外PCIe 交换机本质上是一个存储转发和路由设备引入交换层级会增加端到端延迟。AI 训练中的 NCCL 通信如果走 PCIe 交换需要确认通信库对长距离 PCIe 拓扑的优化情况。我在实际调优中发现相同硬件条件下通信库是否感知交换拓扑性能差距可能高达两位数百分比。这部分不能只看交换机规格要和软件栈一起做整体调优。从我这几年做 GPU 服务器互连和 AI 算力集群的经验来看PCIe 在 Scale-up 领域的价值正被重新定义。Marvell 这颗 260 通道 PCIe 6.0 交换机最大的意义不只是把单芯片带宽拉高了一个量级而是证明了一条比私有封闭方案更开放、更通用的 Scale-up 路径可以走通。对很多不想被单一供应商绑死的团队来说这是值得认真评估的技术路线。如果真的准备用这类芯片做下一代方案我的建议是尽早和芯片原厂拿到参考设计把信号完整性仿真和散热验证提前到原理图阶段别等板卡打样回来再去解决物理层的各种问题。