免费技术解读

Scale-up 和 Scale-out 有何不同?读懂 AI 集群的两层互联

在AI集群中,Scale-up与Scale-out承担不同通信任务。比较通信域、带宽口径和扩展开销,理解增加GPU为何不保证吞吐同比增长。

阿军图解产业 · AI 辅助整理 · · 约 7 分钟阅读

在 AI 加速器集群语境下,Scale-up(向上扩展)与 Scale-out(向外扩展)并不等同于传统 IT 中“单机升级硬件”与“多机堆叠节点”的二元划分,而是共同构成了现代算力系统的两层互联架构。Scale-up 专注于一个紧耦合通信域内多个加速卡之间的紧耦合通信,依靠专用高速总线提供高带宽与低延迟;Scale-out 则负责跨节点、跨机架的分布式集群组网,实现更大规模算力单元的协同。两者并非非此即彼的排他关系,而是在复杂模型训练与推理系统中分工配合、协同运行。

限定语境:为什么不能套用传统数据库的扩展定义?

在传统数据库与常规企业软件架构中,Scale-up 通常指纵向扩展,即通过更换性能更强的 CPU、扩充内存容量或升级存储介质来提升单台服务器的处理能力;Scale-out 则指横向扩展,即通过局域网接入更多常规服务器节点,以分担并发请求。在传统模式下,单机升级往往存在明确的插槽与总线物理上限,两者通常作为两种不同的架构路线供用户二选一。

然而,在由 GPU 或专用 AI 加速器构成的算力集群中,应先确认资料是否采用本文的互联语境。大语言模型等复杂人工智能任务的参数量动辄达到数百亿乃至数千亿,某些配置中的单卡或单服务器显存不足以容纳模型的参数、梯度与优化器状态。这类任务可能需要在张量并行、流水线并行和数据并行等混合策略下被切分到多个计算单元上,这使得计算过程与节点间的数据同步高度交织。

因此,在 AI 基础设施中,两者的界限转变为“通信域”的不同划分:

  • 紧耦合域(Scale-up):将多张加速卡通过高密度专用互联网络连接在一起,卡间可以直接访问对端显存或进行高速数据交换,对外呈现为一个逻辑整体或统一的高性能计算单元。
  • 跨域协同(Scale-out):当单个紧耦合域的物理容纳能力达到上限后,使用集群网络交换机将成百上千个紧耦合单元连接起来,构成超大规模算力网络。

核心机制:四项关键维度的对比

理解 AI 集群的两层互联,需要从网络层级、通信特征以及系统约束四个核心维度进行分解:

比较维度 Scale-up(紧耦合层) Scale-out(跨域网络层)
主要定位 节点内或机架内加速卡间的紧耦合互联 跨节点、跨机架的大规模分布式互联
典型互联技术与实例 厂商专用高速总线,如 NVIDIA 开发者博客关于 NVLink 的说明 中阐述的 Scale-up 专用网络机制 InfiniBand(如 NDR/XDR)、RoCEv2(RDMA over Converged Ethernet)或标准以太网
通信延迟 以具体平台和端到端测试为准,不能等同本地显存访问 受网卡、交换层级、排队与软件影响,需统一测试口径
单卡聚合带宽 面向高带宽卡间通信,需核对方向与聚合口径 相对受限,取决于单节点配备的网卡数量与端口规格
网络拓扑与物理形态 紧凑几何拓扑(全互联、网状或专用交换机板卡),多以铜缆、背板或短距电气连接实现 胖树(Fat-Tree)、Spine-Leaf 等多层交换拓扑,以光模块与光纤布线为主
软件协同逻辑 支撑细粒度并行(如张量并行 Tensor Parallelism),频繁同步部分计算结果 支撑粗粒度并行(如数据并行 Data Parallelism、流水线并行 Pipeline Parallelism)

从实例来看,NVLink 与 InfiniBand 或 Ethernet 并不是对立选择。现代 AI 算力系统通常同时部署两者:在单机柜或节点内部,通过专用高速互联协议构建 Scale-up 网络,支撑张量切分时的高频通信;在机柜之间,则通过 InfiniBand 或高速以太网交换架构搭建 Scale-out 网络,实现跨机架的扩展;跨数据中心还涉及另一层时延和广域网络约束。

同时,对物理指标的理解需区分以下四个方面:

  1. 带宽差异:Scale-up 旨在提供极高的数据吞吐量,以满足矩阵切分后的高频换算需求;Scale-out 受机房布线、交换机端口密度与网卡插槽限制,单卡分摊到的跨节点带宽通常低于其卡内互联带宽。
  2. 延迟差异:卡间直连避免了复杂的网络协议栈封装,通信延迟极低;而跨域网络经过网卡、队列与交换层级,端到端延迟需在相同消息大小和软件条件下比较。
  3. 容量上限:Scale-up 受到单机柜电气布线、信号衰减和机械尺寸限制,单个紧耦合域内的卡数存在明确上限;Scale-out 则能通过增加交换机层级将网络规模扩展至数万张加速卡。
  4. 总功耗与散热:Scale-up 将多卡高度集成,会导致单个机柜的功率密度大幅提升,通常需要专门的水冷或高规格风冷设计;Scale-out 的功耗则分散在多级网络交换机与机房配电系统中。

场景分析:为什么 GPU 数量翻倍并不等速带来算力翻倍?

【注:以下场景与测算逻辑仅作为原理解释的假设分析,非实际测试数据或工程基准。】

在产业规划与设备选型中,常见的误区是假设集群的有效计算吞吐会随着加速卡数量的增加而线性增长。实际上,随着集群规模从单一 Scale-up 域向大规模 Scale-out 网络延伸,通信开销会逐步稀释计算收益。

假设一个模型训练任务:

  1. 在单一 Scale-up 紧耦合域内(假设为 8 卡节点): 各卡之间通过专用高速总线传输参数切片,假设域内通信开销较低,数据传输耗时占总迭代周期的比例较低。此时,计算单元的利用率保持在较高水平,扩展效率较为理想。
  2. 当任务扩展到跨机架的 Scale-out 网络(假设扩展至 32 卡或 64 卡): 即便单节点的 Scale-up 性能未发生变化,节点之间也必须通过网络交换机同步梯度(例如执行 All-Reduce 操作)。假设跨节点通信更慢,具体差异需实测。
  3. 通信开销与同步等待: 分布式训练依赖所有参与节点步调一致。一旦跨域网络发生轻微微突发拥塞,或者某一台服务器出现短暂处理延迟,整体集群都必须等待滞后节点完成数据同步。随着节点数量增加,通信时间在训练周期中的占比提升,不可并行的网络通信开销导致集群的整体扩展效率呈现非线性衰减。

如何读懂技术资料表:四步核对法

当面对一份厂商或系统集成商提供的 AI 集群技术规格表时,建议业务决策者与非专业读者按以下步骤进行信息拆解与核对:

  1. 第一步:核对互联层级与通信域 确认参数表中的技术指标属于哪一层互联。标注为“卡间互联”或“总线带宽”的属于 Scale-up 范畴;标注为“集群网卡”、“以太网交换机”或“IB 网络”的属于 Scale-out 范畴。明确单个紧耦合域到底包含多少张卡,避免将局部指标误判为全局指标。
  2. 第二步:核对带宽定义与统计口径 注意区分“单向带宽(Uni-directional)”与“双向聚合带宽(Bi-directional)”。部分技术宣传会采用全双工叠加后的数字,需将其换算为统一口径。同时,核对单节点对外提供的网络接口总带宽与内部卡间总带宽的比例关系。
  3. 第三步:辨识延迟测试的基准前提 注意区分纯硬件物理层传输延迟(如交换芯片内部转发时延)与包含软件栈的端到端通信延迟。在实际应用中,集合通信库(如 NCCL 等)的调度开销、数据序列化与队列等待均会计入实际耗时,不能仅凭芯片物理时延推断系统性能。
  4. 第四步:评估物理拓扑与机房约束 了解 Scale-up 架构带来的单机柜供电与承重需求。高密度的紧耦合方案往往对供电电压、母线排容量和冷却方式提出特定要求;若数据中心无法满足高功率密度机柜部署,相关硬件配置可能无法按设计规格满载运行。

常见误区与现实权衡

在评估 AI 集群架构时,需要警惕以下几种常见偏差:

  • 误区一:误认为 Scale-up 可以无限制替代 Scale-out 高速总线的电气信号随着传输距离增加而衰减,铜缆连接距离和机箱布线空间存在物理限制。试图无限制扩大单个紧耦合域,会导致连接复杂度与硬件制造成本增加,因此大规模集群必须依赖 Scale-out 网络完成横向拼装。
  • 误区二:误认为通用以太网可以无缝替代专用互联 尽管以太网成本较低且产业链成熟,但在大规模分布式深度学习场景下,传统以太网的丢包重传机制容易引发长尾延迟。若在跨域网络中未引入 RDMA(远程直接数据存取)等低延迟优化机制,Scale-out 层极易成为阻碍集群吞吐的瓶颈。
  • 误区三:将理论峰值带宽等同于业务吞吐效率 硬件标称带宽仅代表物理链路的上限。在实际运行中,模型并行切分策略、张量大小与通信模式是否匹配硬件拓扑,直接决定了带宽的有效利用率。脱离软件调度与模型结构空谈硬件参数,往往会导致实际性能预期出现偏差。

延伸阅读与参考资料

  • 深入了解集群硬件形态与产业链上下游关系,可参考站内已有文章:超节点产业链图解
  • 查阅更多算力网络与算力中心技术架构分析,请浏览:专题合集
  • 建议读者先沿相关文章系统了解技术原理与基础设施架构。如需收藏已有完整图解资料,请前往购买与交付核对当前发布目录与具体交付范围。

文中算例用于解释原理,具体参数请按引用资料与产品条件核对。发现问题,可将文章链接与依据发送至 support@packscena.com

查看全部产业指南 →